BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Xu, Zhu, Wenhao, Hu, Hanxu, He, Conghui, Li, Lei, Huang, Shujian, Yuan, Fei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Could Thinking Multilingually Empower LLM Reasoning?
by: Gao, Changjiang, et al.
Published: (2025)
by: Gao, Changjiang, et al.
Published: (2025)
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
by: Zhu, Wenhao, et al.
Published: (2023)
by: Zhu, Wenhao, et al.
Published: (2023)
LLaMAX2: Your Translation-Enhanced Model also Performs Well in Reasoning
by: Gao, Changjiang, et al.
Published: (2025)
by: Gao, Changjiang, et al.
Published: (2025)
Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning
by: Zhu, Wenhao, et al.
Published: (2025)
by: Zhu, Wenhao, et al.
Published: (2025)
Question Translation Training for Better Multilingual Reasoning
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
by: Luo, Hengyu, et al.
Published: (2025)
by: Luo, Hengyu, et al.
Published: (2025)
The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners
by: Zhang, Shimao, et al.
Published: (2024)
by: Zhang, Shimao, et al.
Published: (2024)
Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages
by: Lu, Yinquan, et al.
Published: (2024)
by: Lu, Yinquan, et al.
Published: (2024)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
by: Li, Jiahuan, et al.
Published: (2023)
by: Li, Jiahuan, et al.
Published: (2023)
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
by: Lei, Fangyu, et al.
Published: (2023)
by: Lei, Fangyu, et al.
Published: (2023)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
by: She, Shuaijie, et al.
Published: (2024)
by: She, Shuaijie, et al.
Published: (2024)
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
by: She, Shuaijie, et al.
Published: (2023)
by: She, Shuaijie, et al.
Published: (2023)
SafetyBench: Evaluating the Safety of Large Language Models
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
SEO: Stochastic Experience Optimization for Large Language Models
by: Xu, Jitao, et al.
Published: (2025)
by: Xu, Jitao, et al.
Published: (2025)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
by: Huang, Xu, et al.
Published: (2024)
by: Huang, Xu, et al.
Published: (2024)
Mitigating the Bias of Large Language Model Evaluation
by: Zhou, Hongli, et al.
Published: (2024)
by: Zhou, Hongli, et al.
Published: (2024)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
by: Huang, Xu, et al.
Published: (2026)
by: Huang, Xu, et al.
Published: (2026)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
by: Aji, Alham Fikri, et al.
Published: (2025)
by: Aji, Alham Fikri, et al.
Published: (2025)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
by: Zou, Wei, et al.
Published: (2025)
by: Zou, Wei, et al.
Published: (2025)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing
by: Zhou, Hao, et al.
Published: (2024)
by: Zhou, Hao, et al.
Published: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
by: Zhang, Min, et al.
Published: (2025)
by: Zhang, Min, et al.
Published: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
by: Huang, Hui, et al.
Published: (2026)
by: Huang, Hui, et al.
Published: (2026)
Source-primed Multi-turn Conversation Helps Large Language Models Translate Documents
by: Hu, Hanxu, et al.
Published: (2025)
by: Hu, Hanxu, et al.
Published: (2025)
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
by: Hu, Peng, et al.
Published: (2024)
by: Hu, Peng, et al.
Published: (2024)
EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling
by: Zhang, Shimao, et al.
Published: (2024)
by: Zhang, Shimao, et al.
Published: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
by: Gao, Junyuan, et al.
Published: (2025)
by: Gao, Junyuan, et al.
Published: (2025)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
by: Xu, Bin, et al.
Published: (2025)
by: Xu, Bin, et al.
Published: (2025)
MindMerger: Efficient Boosting LLM Reasoning in non-English Languages
by: Huang, Zixian, et al.
Published: (2024)
by: Huang, Zixian, et al.
Published: (2024)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
by: Fan, Yuchun, et al.
Published: (2025)
by: Fan, Yuchun, et al.
Published: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
by: Guan, Tianrui, et al.
Published: (2023)
by: Guan, Tianrui, et al.
Published: (2023)
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
by: Hou, Ruijie, et al.
Published: (2025)
by: Hou, Ruijie, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly
by: Gao, Changjiang, et al.
Published: (2024)
by: Gao, Changjiang, et al.
Published: (2024)
Fine-tuning Large Language Models with Sequential Instructions
by: Hu, Hanxu, et al.
Published: (2024)
by: Hu, Hanxu, et al.
Published: (2024)
Similar Items
-
Could Thinking Multilingually Empower LLM Reasoning?
by: Gao, Changjiang, et al.
Published: (2025) -
Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis
by: Zhu, Wenhao, et al.
Published: (2023) -
LLaMAX2: Your Translation-Enhanced Model also Performs Well in Reasoning
by: Gao, Changjiang, et al.
Published: (2025) -
Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning
by: Zhu, Wenhao, et al.
Published: (2025) -
Question Translation Training for Better Multilingual Reasoning
by: Zhu, Wenhao, et al.
Published: (2024)