M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Zhao, Chunguang, Liu, Yilun, Zeng, Pufan, Luo, Yuanchang, Tao, Shimin, He, Minggui, Meng, Weibin, Xu, Song, Liu, Chen, Ma, Hongxia, Zhang, Li, Chen, Boxing, Wei, Daimeng
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866910178368028672
author Zhao, Chunguang
Liu, Yilun
Zeng, Pufan
Luo, Yuanchang
Tao, Shimin
He, Minggui
Meng, Weibin
Xu, Song
Liu, Chen
Ma, Hongxia
Zhang, Li
Chen, Boxing
Wei, Daimeng
author_facet Zhao, Chunguang
Liu, Yilun
Zeng, Pufan
Luo, Yuanchang
Tao, Shimin
He, Minggui
Meng, Weibin
Xu, Song
Liu, Chen
Ma, Hongxia
Zhang, Li
Chen, Boxing
Wei, Daimeng
contents Multilingual instruction fine-tuning (IFT) empowers large language models to generalize across diverse linguistic and cultural contexts; however, high-quality, systematically curated multilingual IFT datasets remain scarce. To address this gap, we propose M-DaQ (Multilingual Diversity and Quality), a diversity-aware sampling framework that jointly optimizes instruction-response quality and cross-lingual semantic diversity. M-DaQ leverages a fine-tuned Quality Scoring Model alongside a maximal marginal relevance-inspired selection strategy to construct balanced, high-fidelity training data. Furthermore, we present the first systematic investigation of the Superficial Alignment Hypothesis in multilingual settings. Extensive evaluations across 18 languages demonstrate that models trained on M-DaQ-curated data achieve average win rates exceeding 60% against strong baselines on Alpaca-Eval and MT-Bench. Complementary human evaluations corroborate these gains, highlighting significant improvements in cultural relevance, contextual appropriateness, and instruction-following capability. The code are publicly released to facilitate reproducibility and future research.
format Preprint
id arxiv_https___arxiv_org_abs_2509_15549
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
Zhao, Chunguang
Liu, Yilun
Zeng, Pufan
Luo, Yuanchang
Tao, Shimin
He, Minggui
Meng, Weibin
Xu, Song
Liu, Chen
Ma, Hongxia
Zhang, Li
Chen, Boxing
Wei, Daimeng
Computation and Language
Multilingual instruction fine-tuning (IFT) empowers large language models to generalize across diverse linguistic and cultural contexts; however, high-quality, systematically curated multilingual IFT datasets remain scarce. To address this gap, we propose M-DaQ (Multilingual Diversity and Quality), a diversity-aware sampling framework that jointly optimizes instruction-response quality and cross-lingual semantic diversity. M-DaQ leverages a fine-tuned Quality Scoring Model alongside a maximal marginal relevance-inspired selection strategy to construct balanced, high-fidelity training data. Furthermore, we present the first systematic investigation of the Superficial Alignment Hypothesis in multilingual settings. Extensive evaluations across 18 languages demonstrate that models trained on M-DaQ-curated data achieve average win rates exceeding 60% against strong baselines on Alpaca-Eval and MT-Bench. Complementary human evaluations corroborate these gains, highlighting significant improvements in cultural relevance, contextual appropriateness, and instruction-following capability. The code are publicly released to facilitate reproducibility and future research.
title M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
topic Computation and Language
url https://arxiv.org/abs/2509.15549