Multi-lingual Functional Evaluation for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ojewale, Victor, Raji, Inioluwa Deborah, Venkatasubramanian, Suresh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Audit Trails for Accountability in Large Language Models
by: Ojewale, Victor, et al.
Published: (2026)
by: Ojewale, Victor, et al.
Published: (2026)
Towards AI Accountability Infrastructure: Gaps and Opportunities in AI Audit Tooling
by: Ojewale, Victor, et al.
Published: (2024)
by: Ojewale, Victor, et al.
Published: (2024)
AI auditing: The Broken Bus on the Road to AI Accountability
by: Birhane, Abeba, et al.
Published: (2024)
by: Birhane, Abeba, et al.
Published: (2024)
Medical Large Language Model Benchmarks Should Prioritize Construct Validity
by: Alaa, Ahmed, et al.
Published: (2025)
by: Alaa, Ahmed, et al.
Published: (2025)
Evaluating Prediction-based Interventions with Human Decision Makers In Mind
by: Raji, Inioluwa Deborah, et al.
Published: (2025)
by: Raji, Inioluwa Deborah, et al.
Published: (2025)
"I Searched for a Religious Song in Amharic and Got Sexual Content Instead": Investigating Online Harm in Low-Resourced Languages on YouTube
by: Nigatu, Hellina Hailu, et al.
Published: (2024)
by: Nigatu, Hellina Hailu, et al.
Published: (2024)
Concrete Problems in AI Safety, Revisited
by: Raji, Inioluwa Deborah, et al.
Published: (2023)
by: Raji, Inioluwa Deborah, et al.
Published: (2023)
Large Language Models are Good Multi-lingual Learners : When LLMs Meet Cross-lingual Prompts
by: Wang, Teng, et al.
Published: (2024)
by: Wang, Teng, et al.
Published: (2024)
Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models
by: Xing, Xiaolin, et al.
Published: (2024)
by: Xing, Xiaolin, et al.
Published: (2024)
Aggregated Individual Reporting for Post-Deployment Evaluation
by: Dai, Jessica, et al.
Published: (2025)
by: Dai, Jessica, et al.
Published: (2025)
Extracting and Combining Abilities For Building Multi-lingual Ability-enhanced Large Language Models
by: Chen, Zhipeng, et al.
Published: (2024)
by: Chen, Zhipeng, et al.
Published: (2024)
Quo Vadis ChatGPT? From Large Language Models to Large Knowledge Models
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
by: Venkatasubramanian, Venkat, et al.
Published: (2024)
Evaluating Large Language Models along Dimensions of Language Variation: A Systematik Invesdigatiom uv Cross-lingual Generalization
by: Bafna, Niyati, et al.
Published: (2024)
by: Bafna, Niyati, et al.
Published: (2024)
Large Language Models for Cross-lingual Emotion Detection
by: Kadiyala, Ram Mohan Rao
Published: (2024)
by: Kadiyala, Ram Mohan Rao
Published: (2024)
From Individual Experience to Collective Evidence: A Reporting-Based Framework for Identifying Systemic Harms
by: Dai, Jessica, et al.
Published: (2025)
by: Dai, Jessica, et al.
Published: (2025)
The Model Arena for Cross-lingual Sentiment Analysis: A Comparative Study in the Era of Large Language Models
by: Zhu, Xiliang, et al.
Published: (2024)
by: Zhu, Xiliang, et al.
Published: (2024)
Cross-lingual Cross-temporal Summarization: Dataset, Models, Evaluation
by: Zhang, Ran, et al.
Published: (2023)
by: Zhang, Ran, et al.
Published: (2023)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
by: Park, Cheonbok, et al.
Published: (2025)
by: Park, Cheonbok, et al.
Published: (2025)
Cross-lingual Editing in Multilingual Language Models
by: Beniwal, Himanshu, et al.
Published: (2024)
by: Beniwal, Himanshu, et al.
Published: (2024)
Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models
by: Elhady, Ahmed, et al.
Published: (2026)
by: Elhady, Ahmed, et al.
Published: (2026)
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
by: Blevins, Terra, et al.
Published: (2024)
by: Blevins, Terra, et al.
Published: (2024)
What's in an embedding? Would a rose by any embedding smell as sweet?
by: Venkatasubramanian, Venkat
Published: (2024)
by: Venkatasubramanian, Venkat
Published: (2024)
Navigating Dialectal Bias and Ethical Complexities in Levantine Arabic Hate Speech Detection
by: Ahmed, Ahmed Haj, et al.
Published: (2024)
by: Ahmed, Ahmed Haj, et al.
Published: (2024)
Multi-lingual Multi-turn Automated Red Teaming for LLMs
by: Singhania, Abhishek, et al.
Published: (2025)
by: Singhania, Abhishek, et al.
Published: (2025)
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language Models
by: He, Zhiwei, et al.
Published: (2024)
by: He, Zhiwei, et al.
Published: (2024)
Empowering Cross-lingual Abilities of Instruction-tuned Large Language Models by Translation-following demonstrations
by: Ranaldi, Leonardo, et al.
Published: (2023)
by: Ranaldi, Leonardo, et al.
Published: (2023)
Benchmarks Underestimate the Readiness of Multi-lingual Dialogue Agents
by: Lee, Andrew H., et al.
Published: (2024)
by: Lee, Andrew H., et al.
Published: (2024)
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models
by: Wang, Mingyang, et al.
Published: (2025)
by: Wang, Mingyang, et al.
Published: (2025)
Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment
by: Li, Chong, et al.
Published: (2023)
by: Li, Chong, et al.
Published: (2023)
Efficient Training for Cross-lingual Speech Language Models
by: Zhou, Yan, et al.
Published: (2026)
by: Zhou, Yan, et al.
Published: (2026)
Language Fusion for Parameter-Efficient Cross-lingual Transfer
by: Borchert, Philipp, et al.
Published: (2025)
by: Borchert, Philipp, et al.
Published: (2025)
TEII: Think, Explain, Interact and Iterate with Large Language Models to Solve Cross-lingual Emotion Detection
by: Cheng, Long, et al.
Published: (2024)
by: Cheng, Long, et al.
Published: (2024)
Multi-lingual Multi-institutional Electronic Health Record based Predictive Model
by: Hur, Kyunghoon, et al.
Published: (2026)
by: Hur, Kyunghoon, et al.
Published: (2026)
GlobeSumm: A Challenging Benchmark Towards Unifying Multi-lingual, Cross-lingual and Multi-document News Summarization
by: Ye, Yangfan, et al.
Published: (2024)
by: Ye, Yangfan, et al.
Published: (2024)
Improving Multi-lingual Alignment Through Soft Contrastive Learning
by: Park, Minsu, et al.
Published: (2024)
by: Park, Minsu, et al.
Published: (2024)
Large Language Models for Multi-Choice Question Classification of Medical Subjects
by: Ponce-López, Víctor
Published: (2024)
by: Ponce-López, Víctor
Published: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
by: He, Jie, et al.
Published: (2025)
by: He, Jie, et al.
Published: (2025)
Effectively Prompting Small-sized Language Models for Cross-lingual Tasks via Winning Tickets
by: Li, Mingqi, et al.
Published: (2024)
by: Li, Mingqi, et al.
Published: (2024)
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
by: Park, Dojun, et al.
Published: (2024)
by: Park, Dojun, et al.
Published: (2024)
Evaluating the Capabilities of Large Language Models for Multi-label Emotion Understanding
by: Belay, Tadesse Destaw, et al.
Published: (2024)
by: Belay, Tadesse Destaw, et al.
Published: (2024)
Similar Items
-
Audit Trails for Accountability in Large Language Models
by: Ojewale, Victor, et al.
Published: (2026) -
Towards AI Accountability Infrastructure: Gaps and Opportunities in AI Audit Tooling
by: Ojewale, Victor, et al.
Published: (2024) -
AI auditing: The Broken Bus on the Road to AI Accountability
by: Birhane, Abeba, et al.
Published: (2024) -
Medical Large Language Model Benchmarks Should Prioritize Construct Validity
by: Alaa, Ahmed, et al.
Published: (2025) -
Evaluating Prediction-based Interventions with Human Decision Makers In Mind
by: Raji, Inioluwa Deborah, et al.
Published: (2025)