Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Zeng, Bo, Lyu, Chenyang, Liu, Sinuo, Zeng, Mingyan, Wu, Minghao, Ni, Xuanfan, Shi, Tianqi, Zhao, Yu, Liu, Yefeng, Zhu, Chenyu, Li, Ruizhe, Geng, Jiahui, Li, Qing, Tong, Yu, Wang, Longyue, Luo, Weihua, Zhang, Kaifu
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866915392086081536
author Zeng, Bo
Lyu, Chenyang
Liu, Sinuo
Zeng, Mingyan
Wu, Minghao
Ni, Xuanfan
Shi, Tianqi
Zhao, Yu
Liu, Yefeng
Zhu, Chenyu
Li, Ruizhe
Geng, Jiahui
Li, Qing
Tong, Yu
Wang, Longyue
Luo, Weihua
Zhang, Kaifu
author_facet Zeng, Bo
Lyu, Chenyang
Liu, Sinuo
Zeng, Mingyan
Wu, Minghao
Ni, Xuanfan
Shi, Tianqi
Zhao, Yu
Liu, Yefeng
Zhu, Chenyu
Li, Ruizhe
Geng, Jiahui
Li, Qing
Tong, Yu
Wang, Longyue
Luo, Weihua
Zhang, Kaifu
contents Instruction-following capability has become a major ability to be evaluated for Large Language Models (LLMs). However, existing datasets, such as IFEval, are either predominantly monolingual and centered on English or simply machine translated to other languages, limiting their applicability in multilingual contexts. In this paper, we present an carefully-curated extension of IFEval to a localized multilingual version named Marco-Bench-MIF, covering 30 languages with varying levels of localization. Our benchmark addresses linguistic constraints (e.g., modifying capitalization requirements for Chinese) and cultural references (e.g., substituting region-specific company names in prompts) via a hybrid pipeline combining translation with verification. Through comprehensive evaluation of 20+ LLMs on our Marco-Bench-MIF, we found that: (1) 25-35% accuracy gap between high/low-resource languages, (2) model scales largely impact performance by 45-60% yet persists script-specific challenges, and (3) machine-translated data underestimates accuracy by7-22% versus localized data. Our analysis identifies challenges in multilingual instruction following, including keyword consistency preservation and compositional constraint adherence across languages. Our Marco-Bench-MIF is available at https://github.com/AIDC-AI/Marco-Bench-MIF.
format Preprint
id arxiv_https___arxiv_org_abs_2507_11882
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
Zeng, Bo
Lyu, Chenyang
Liu, Sinuo
Zeng, Mingyan
Wu, Minghao
Ni, Xuanfan
Shi, Tianqi
Zhao, Yu
Liu, Yefeng
Zhu, Chenyu
Li, Ruizhe
Geng, Jiahui
Li, Qing
Tong, Yu
Wang, Longyue
Luo, Weihua
Zhang, Kaifu
Computation and Language
Instruction-following capability has become a major ability to be evaluated for Large Language Models (LLMs). However, existing datasets, such as IFEval, are either predominantly monolingual and centered on English or simply machine translated to other languages, limiting their applicability in multilingual contexts. In this paper, we present an carefully-curated extension of IFEval to a localized multilingual version named Marco-Bench-MIF, covering 30 languages with varying levels of localization. Our benchmark addresses linguistic constraints (e.g., modifying capitalization requirements for Chinese) and cultural references (e.g., substituting region-specific company names in prompts) via a hybrid pipeline combining translation with verification. Through comprehensive evaluation of 20+ LLMs on our Marco-Bench-MIF, we found that: (1) 25-35% accuracy gap between high/low-resource languages, (2) model scales largely impact performance by 45-60% yet persists script-specific challenges, and (3) machine-translated data underestimates accuracy by7-22% versus localized data. Our analysis identifies challenges in multilingual instruction following, including keyword consistency preservation and compositional constraint adherence across languages. Our Marco-Bench-MIF is available at https://github.com/AIDC-AI/Marco-Bench-MIF.
title Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
topic Computation and Language
url https://arxiv.org/abs/2507.11882