M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Chunguang, Liu, Yilun, Zeng, Pufan, Luo, Yuanchang, Tao, Shimin, He, Minggui, Meng, Weibin, Xu, Song, Liu, Chen, Ma, Hongxia, Zhang, Li, Chen, Boxing, Wei, Daimeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis
by: Liu, Yilun, et al.
Published: (2025)
by: Liu, Yilun, et al.
Published: (2025)
C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment
by: Zeng, Pufan, et al.
Published: (2026)
by: Zeng, Pufan, et al.
Published: (2026)
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
by: He, Minggui, et al.
Published: (2025)
by: He, Minggui, et al.
Published: (2025)
RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning
by: Xu, Song, et al.
Published: (2025)
by: Xu, Song, et al.
Published: (2025)
ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction
by: Yu, Yan, et al.
Published: (2025)
by: Yu, Yan, et al.
Published: (2025)
Stream DaQ: Stream-First Data Quality Monitoring
by: Papastergios, Vasileios, et al.
Published: (2025)
by: Papastergios, Vasileios, et al.
Published: (2025)
LogLM: From Task-based to Instruction-based Automated Log Analysis
by: Liu, Yilun, et al.
Published: (2024)
by: Liu, Yilun, et al.
Published: (2024)
Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality Estimation
by: Ge, Yuan, et al.
Published: (2024)
by: Ge, Yuan, et al.
Published: (2024)
Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation
by: He, Minggui, et al.
Published: (2026)
by: He, Minggui, et al.
Published: (2026)
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
by: Liu, Yilun, et al.
Published: (2026)
by: Liu, Yilun, et al.
Published: (2026)
R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning
by: Liu, Yilun, et al.
Published: (2025)
by: Liu, Yilun, et al.
Published: (2025)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
by: Liu, Yilun, et al.
Published: (2023)
by: Liu, Yilun, et al.
Published: (2023)
Adapting Large Language Models to Log Analysis with Interpretable Domain Knowledge
by: Ji, Yuhe, et al.
Published: (2024)
by: Ji, Yuhe, et al.
Published: (2024)
Taming Text-to-Image Synthesis for Novices: User-centric Prompt Generation via Multi-turn Guidance
by: Liu, Yilun, et al.
Published: (2024)
by: Liu, Yilun, et al.
Published: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
by: Liu, Yangzhou, et al.
Published: (2024)
by: Liu, Yangzhou, et al.
Published: (2024)
From Handcrafted Features to LLMs: A Brief Survey for Machine Translation Quality Estimation
by: Zhao, Haofei, et al.
Published: (2024)
by: Zhao, Haofei, et al.
Published: (2024)
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
by: Pandey, Prabhat, et al.
Published: (2025)
by: Pandey, Prabhat, et al.
Published: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
by: Dang, Renfei, et al.
Published: (2026)
by: Dang, Renfei, et al.
Published: (2026)
"Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation
by: Thakur, Nandan, et al.
Published: (2023)
by: Thakur, Nandan, et al.
Published: (2023)
Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
by: Lu, Yiting, et al.
Published: (2025)
by: Lu, Yiting, et al.
Published: (2025)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
by: Chen, Yijie, et al.
Published: (2026)
by: Chen, Yijie, et al.
Published: (2026)
sPhinX: Sample Efficient Multilingual Instruction Fine-Tuning Through N-shot Guided Prompting
by: Ahuja, Sanchit, et al.
Published: (2024)
by: Ahuja, Sanchit, et al.
Published: (2024)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
by: Lu, Ning, et al.
Published: (2025)
by: Lu, Ning, et al.
Published: (2025)
An Economic Analysis of Electricity Consumption and Electric Vehicle Adoption in California from 2010 to 2021
by: Qi, Pufan
Published: (2025)
by: Qi, Pufan
Published: (2025)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
by: Liu, Wanlong, et al.
Published: (2024)
by: Liu, Wanlong, et al.
Published: (2024)
Parrot: Multilingual Visual Instruction Tuning
by: Sun, Hai-Long, et al.
Published: (2024)
by: Sun, Hai-Long, et al.
Published: (2024)
D3: Diversity, Difficulty, and Dependability-Aware Data Selection for Sample-Efficient LLM Instruction Tuning
by: Zhang, Jia, et al.
Published: (2025)
by: Zhang, Jia, et al.
Published: (2025)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
by: Wang, Peiqi, et al.
Published: (2024)
by: Wang, Peiqi, et al.
Published: (2024)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
by: Ma, Xu, et al.
Published: (2026)
by: Ma, Xu, et al.
Published: (2026)
From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning
by: Li, Haoyu, et al.
Published: (2025)
by: Li, Haoyu, et al.
Published: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
by: Zhou, Shijie, et al.
Published: (2024)
by: Zhou, Shijie, et al.
Published: (2024)
Improving Multilingual Instruction Finetuning via Linguistically Natural and Diverse Datasets
by: Indurthi, Sathish Reddy, et al.
Published: (2024)
by: Indurthi, Sathish Reddy, et al.
Published: (2024)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
by: Ruan, Zhiwen, et al.
Published: (2026)
by: Ruan, Zhiwen, et al.
Published: (2026)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
by: Heuillet, Maxime, et al.
Published: (2025)
by: Heuillet, Maxime, et al.
Published: (2025)
Mitigating Outlier Activations in Low-Precision Fine-Tuning of Language Models
by: Ghaffari, Alireza, et al.
Published: (2023)
by: Ghaffari, Alireza, et al.
Published: (2023)
Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation Refinement
by: Dong, Yichen, et al.
Published: (2025)
by: Dong, Yichen, et al.
Published: (2025)
Chain-of-Description: What I can understand, I can put into words
by: Guo, Jiaxin, et al.
Published: (2025)
by: Guo, Jiaxin, et al.
Published: (2025)
Multilingual Instruction Tuning With Just a Pinch of Multilinguality
by: Shaham, Uri, et al.
Published: (2024)
by: Shaham, Uri, et al.
Published: (2024)
Investigating Multilingual Instruction-Tuning: Do Polyglot Models Demand for Multilingual Instructions?
by: Weber, Alexander Arno, et al.
Published: (2024)
by: Weber, Alexander Arno, et al.
Published: (2024)
Similar Items
-
MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis
by: Liu, Yilun, et al.
Published: (2025) -
C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment
by: Zeng, Pufan, et al.
Published: (2026) -
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
by: He, Minggui, et al.
Published: (2025) -
RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning
by: Xu, Song, et al.
Published: (2025) -
ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction
by: Yu, Yan, et al.
Published: (2025)