MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Wenhan, Zhang, Yifan, Chen, Zhixun, Liu, Binbin, Lin, Haobin, Zhang, Bingni, Wang, Taifeng, Pechenizkiy, Mykola, Fang, Meng, Zheng, Yin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
by: Chen, Zhixun, et al.
Published: (2025)
by: Chen, Zhixun, et al.
Published: (2025)
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
by: Guo, Ping, et al.
Published: (2025)
by: Guo, Ping, et al.
Published: (2025)
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
by: Liu, Fengze, et al.
Published: (2026)
by: Liu, Fengze, et al.
Published: (2026)
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
by: Schipper, Olivier, et al.
Published: (2025)
by: Schipper, Olivier, et al.
Published: (2025)
Large Language Models Are Neurosymbolic Reasoners
by: Fang, Meng, et al.
Published: (2024)
by: Fang, Meng, et al.
Published: (2024)
QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining
by: Liu, Fengze, et al.
Published: (2025)
by: Liu, Fengze, et al.
Published: (2025)
MedINST: Meta Dataset of Biomedical Instructions
by: Han, Wenhan, et al.
Published: (2024)
by: Han, Wenhan, et al.
Published: (2024)
HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents
by: Tomilin, Tristan, et al.
Published: (2025)
by: Tomilin, Tristan, et al.
Published: (2025)
One Model for All: Multi-Objective Controllable Language Models
by: He, Qiang, et al.
Published: (2026)
by: He, Qiang, et al.
Published: (2026)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
by: Zeng, Bo, et al.
Published: (2025)
by: Zeng, Bo, et al.
Published: (2025)
On Adversarial Robustness of Language Models in Transfer Learning
by: Turbal, Bohdan, et al.
Published: (2024)
by: Turbal, Bohdan, et al.
Published: (2024)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
by: Zheng, Shunfeng, et al.
Published: (2025)
by: Zheng, Shunfeng, et al.
Published: (2025)
Task Adaptation from Skills: Information Geometry, Disentanglement, and New Objectives for Unsupervised Reinforcement Learning
by: Yang, Yucheng, et al.
Published: (2025)
by: Yang, Yucheng, et al.
Published: (2025)
RuAG: Learned-rule-augmented Generation for Large Language Models
by: Zhang, Yudi, et al.
Published: (2024)
by: Zhang, Yudi, et al.
Published: (2024)
Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models
by: Tang, Tianyi, et al.
Published: (2024)
by: Tang, Tianyi, et al.
Published: (2024)
MoORE: SVD-based Model MoE-ization for Conflict- and Oblivion-Resistant Multi-Task Adaptation
by: Yuan, Shen, et al.
Published: (2025)
by: Yuan, Shen, et al.
Published: (2025)
Everyone deserves their voice to be heard: Analyzing Predictive Gender Bias in ASR Models Applied to Dutch Speech Data
by: Raes, Rik, et al.
Published: (2024)
by: Raes, Rik, et al.
Published: (2024)
Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling
by: Provodin, Danil, et al.
Published: (2024)
by: Provodin, Danil, et al.
Published: (2024)
FairSNA: Algorithmic Fairness in Social Network Analysis
by: Saxena, Akrati, et al.
Published: (2022)
by: Saxena, Akrati, et al.
Published: (2022)
Are There Exceptions to Goodhart's Law? On the Moral Justification of Fairness-Aware Machine Learning
by: Weerts, Hilde, et al.
Published: (2022)
by: Weerts, Hilde, et al.
Published: (2022)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
by: Chua, Lynn, et al.
Published: (2024)
by: Chua, Lynn, et al.
Published: (2024)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
by: Zhang, Yudi, et al.
Published: (2025)
by: Zhang, Yudi, et al.
Published: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
by: Feng, Jie, et al.
Published: (2024)
by: Feng, Jie, et al.
Published: (2024)
TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models
by: Zhang, Quanjun, et al.
Published: (2024)
by: Zhang, Quanjun, et al.
Published: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
by: Wang, Peiding, et al.
Published: (2025)
by: Wang, Peiding, et al.
Published: (2025)
Robust Active Learning (RoAL): Countering Dynamic Adversaries in Active Learning with Elastic Weight Consolidation
by: Fajri, Ricky Maulana, et al.
Published: (2024)
by: Fajri, Ricky Maulana, et al.
Published: (2024)
All Language Models Large and Small
by: Chen, Zhixun, et al.
Published: (2024)
by: Chen, Zhixun, et al.
Published: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
by: Que, Haoran, et al.
Published: (2024)
by: Que, Haoran, et al.
Published: (2024)
ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
by: Banerjee, Somnath, et al.
Published: (2025)
by: Banerjee, Somnath, et al.
Published: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
by: Guo, Jiawei, et al.
Published: (2024)
by: Guo, Jiawei, et al.
Published: (2024)
One-Shot Federated Learning with Bayesian Pseudocoresets
by: d'Hondt, Tim, et al.
Published: (2024)
by: d'Hondt, Tim, et al.
Published: (2024)
DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
by: Li, Yifan, et al.
Published: (2025)
by: Li, Yifan, et al.
Published: (2025)
Natural Language but Omitted? On the Ineffectiveness of Large Language Models' privacy policy from End-users' Perspective
by: Zhang, Shuning, et al.
Published: (2024)
by: Zhang, Shuning, et al.
Published: (2024)
CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment
by: Feng, Rui, et al.
Published: (2025)
by: Feng, Rui, et al.
Published: (2025)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
by: Zhang, Yuanchi, et al.
Published: (2024)
by: Zhang, Yuanchi, et al.
Published: (2024)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
by: Singh, Harman, et al.
Published: (2024)
by: Singh, Harman, et al.
Published: (2024)
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
by: Yang, Yilun, et al.
Published: (2025)
by: Yang, Yilun, et al.
Published: (2025)
DebugBench: Evaluating Debugging Capability of Large Language Models
by: Tian, Runchu, et al.
Published: (2024)
by: Tian, Runchu, et al.
Published: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
by: Li, Jianling, et al.
Published: (2025)
by: Li, Jianling, et al.
Published: (2025)
Similar Items
-
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
by: Chen, Zhixun, et al.
Published: (2025) -
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
by: Guo, Ping, et al.
Published: (2025) -
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
by: Liu, Fengze, et al.
Published: (2026) -
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
by: Schipper, Olivier, et al.
Published: (2025) -
Large Language Models Are Neurosymbolic Reasoners
by: Fang, Meng, et al.
Published: (2024)