MiLiC-Eval: Benchmarking Multilingual LLMs for China's Minority Languages
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Chen, Tao, Mingxu, Liao, Zhiyuan, Feng, Yansong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MC$^2$: Towards Transparent and Culturally-Aware NLP for Minority Languages in China
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
von: Hu, Yutong, et al.
Veröffentlicht: (2024)
von: Hu, Yutong, et al.
Veröffentlicht: (2024)
Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon
von: Zhang, Chen, et al.
Veröffentlicht: (2025)
von: Zhang, Chen, et al.
Veröffentlicht: (2025)
Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
von: Zhang, Chen, et al.
Veröffentlicht: (2026)
von: Zhang, Chen, et al.
Veröffentlicht: (2026)
Probing Multimodal Large Language Models for Global and Local Semantic Representations
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
Unlocking the Potential of Model Merging for Low-Resource Languages
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
von: Tao, Mingxu, et al.
Veröffentlicht: (2024)
CMHG: A Dataset and Benchmark for Headline Generation of Minority Languages in China
von: Xu, Guixian, et al.
Veröffentlicht: (2025)
von: Xu, Guixian, et al.
Veröffentlicht: (2025)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
von: Raihan, Nishat, et al.
Veröffentlicht: (2024)
von: Raihan, Nishat, et al.
Veröffentlicht: (2024)
EpiCoDe: Boosting Model Performance Beyond Training with Extrapolation and Contrastive Decoding
von: Tao, Mingxu, et al.
Veröffentlicht: (2025)
von: Tao, Mingxu, et al.
Veröffentlicht: (2025)
MdEval: Massively Multilingual Code Debugging
von: Liu, Shukai, et al.
Veröffentlicht: (2024)
von: Liu, Shukai, et al.
Veröffentlicht: (2024)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
von: Peng, Qiwei, et al.
Veröffentlicht: (2024)
von: Peng, Qiwei, et al.
Veröffentlicht: (2024)
Isolating Language-Coding from Problem-Solving: Benchmarking LLMs with PseudoEval
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
von: Wu, Jiarong, et al.
Veröffentlicht: (2025)
AcademicEval: Live Long-Context LLM Benchmark
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
LatEval: An Interactive LLMs Evaluation Benchmark with Incomplete Information from Lateral Thinking Puzzles
von: Huang, Shulin, et al.
Veröffentlicht: (2023)
von: Huang, Shulin, et al.
Veröffentlicht: (2023)
HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks
von: Pomerenke, David, et al.
Veröffentlicht: (2025)
von: Pomerenke, David, et al.
Veröffentlicht: (2025)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
Teaching Large Language Models an Unseen Language on the Fly
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
von: Park, Dojun, et al.
Veröffentlicht: (2024)
von: Park, Dojun, et al.
Veröffentlicht: (2024)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
von: Son, Guijin, et al.
Veröffentlicht: (2024)
von: Son, Guijin, et al.
Veröffentlicht: (2024)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
von: Du, Junjia, et al.
Veröffentlicht: (2025)
von: Du, Junjia, et al.
Veröffentlicht: (2025)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2025)
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2025)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
von: Sinha, Samridhi Raj, et al.
Veröffentlicht: (2025)
von: Sinha, Samridhi Raj, et al.
Veröffentlicht: (2025)
ELLA: Empowering LLMs for Interpretable, Accurate and Informative Legal Advice
von: Hu, Yutong, et al.
Veröffentlicht: (2024)
von: Hu, Yutong, et al.
Veröffentlicht: (2024)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
von: Zhang, Mengyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Mengyuan, et al.
Veröffentlicht: (2024)
StackEval: Benchmarking LLMs in Coding Assistance
von: Shah, Nidhish, et al.
Veröffentlicht: (2024)
von: Shah, Nidhish, et al.
Veröffentlicht: (2024)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
von: He, Chaoqun, et al.
Veröffentlicht: (2024)
von: He, Chaoqun, et al.
Veröffentlicht: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
von: He, Yun, et al.
Veröffentlicht: (2024)
von: He, Yun, et al.
Veröffentlicht: (2024)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
von: Kang, Zhaolu, et al.
Veröffentlicht: (2026)
von: Kang, Zhaolu, et al.
Veröffentlicht: (2026)
TUM-MiKaNi at SemEval-2025 Task 3: Towards Multilingual and Knowledge-Aware Non-factual Hallucination Identification
von: Anschütz, Miriam, et al.
Veröffentlicht: (2025)
von: Anschütz, Miriam, et al.
Veröffentlicht: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
von: Chen, Nan, et al.
Veröffentlicht: (2024)
von: Chen, Nan, et al.
Veröffentlicht: (2024)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
von: Zhu, Junnan, et al.
Veröffentlicht: (2025)
von: Zhu, Junnan, et al.
Veröffentlicht: (2025)
MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM Finetuning
von: Wang, Hanqing, et al.
Veröffentlicht: (2024)
von: Wang, Hanqing, et al.
Veröffentlicht: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
von: Li, Haitao, et al.
Veröffentlicht: (2024)
von: Li, Haitao, et al.
Veröffentlicht: (2024)
GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
von: Luo, Hengyu, et al.
Veröffentlicht: (2025)
von: Luo, Hengyu, et al.
Veröffentlicht: (2025)
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
von: Chen, Yongrui, et al.
Veröffentlicht: (2026)
von: Chen, Yongrui, et al.
Veröffentlicht: (2026)
ALOHA: Empowering Multilingual Agent for University Orientation with Hierarchical Retrieval
von: Tao, Mingxu, et al.
Veröffentlicht: (2025)
von: Tao, Mingxu, et al.
Veröffentlicht: (2025)
Controlling Language Confusion in Multilingual LLMs
von: Lee, Nahyun, et al.
Veröffentlicht: (2025)
von: Lee, Nahyun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MC$^2$: Towards Transparent and Culturally-Aware NLP for Minority Languages in China
von: Zhang, Chen, et al.
Veröffentlicht: (2023) -
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
von: Hu, Yutong, et al.
Veröffentlicht: (2024) -
Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering
von: Tao, Mingxu, et al.
Veröffentlicht: (2024) -
Cross-Lingual Transfer of Cultural Knowledge: An Asymmetric Phenomenon
von: Zhang, Chen, et al.
Veröffentlicht: (2025) -
Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
von: Zhang, Chen, et al.
Veröffentlicht: (2026)