M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Chunguang, Liu, Yilun, Zeng, Pufan, Luo, Yuanchang, Tao, Shimin, He, Minggui, Meng, Weibin, Xu, Song, Liu, Chen, Ma, Hongxia, Zhang, Li, Chen, Boxing, Wei, Daimeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis
por: Liu, Yilun, et al.
Publicado: (2025)
por: Liu, Yilun, et al.
Publicado: (2025)
C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment
por: Zeng, Pufan, et al.
Publicado: (2026)
por: Zeng, Pufan, et al.
Publicado: (2026)
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
por: He, Minggui, et al.
Publicado: (2025)
por: He, Minggui, et al.
Publicado: (2025)
RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning
por: Xu, Song, et al.
Publicado: (2025)
por: Xu, Song, et al.
Publicado: (2025)
ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction
por: Yu, Yan, et al.
Publicado: (2025)
por: Yu, Yan, et al.
Publicado: (2025)
Stream DaQ: Stream-First Data Quality Monitoring
por: Papastergios, Vasileios, et al.
Publicado: (2025)
por: Papastergios, Vasileios, et al.
Publicado: (2025)
LogLM: From Task-based to Instruction-based Automated Log Analysis
por: Liu, Yilun, et al.
Publicado: (2024)
por: Liu, Yilun, et al.
Publicado: (2024)
Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality Estimation
por: Ge, Yuan, et al.
Publicado: (2024)
por: Ge, Yuan, et al.
Publicado: (2024)
Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation
por: He, Minggui, et al.
Publicado: (2026)
por: He, Minggui, et al.
Publicado: (2026)
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
por: Liu, Yilun, et al.
Publicado: (2026)
por: Liu, Yilun, et al.
Publicado: (2026)
R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning
por: Liu, Yilun, et al.
Publicado: (2025)
por: Liu, Yilun, et al.
Publicado: (2025)
CoachLM: Automatic Instruction Revisions Improve the Data Quality in LLM Instruction Tuning
por: Liu, Yilun, et al.
Publicado: (2023)
por: Liu, Yilun, et al.
Publicado: (2023)
Adapting Large Language Models to Log Analysis with Interpretable Domain Knowledge
por: Ji, Yuhe, et al.
Publicado: (2024)
por: Ji, Yuhe, et al.
Publicado: (2024)
Taming Text-to-Image Synthesis for Novices: User-centric Prompt Generation via Multi-turn Guidance
por: Liu, Yilun, et al.
Publicado: (2024)
por: Liu, Yilun, et al.
Publicado: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
por: Liu, Yangzhou, et al.
Publicado: (2024)
por: Liu, Yangzhou, et al.
Publicado: (2024)
From Handcrafted Features to LLMs: A Brief Survey for Machine Translation Quality Estimation
por: Zhao, Haofei, et al.
Publicado: (2024)
por: Zhao, Haofei, et al.
Publicado: (2024)
SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning
por: Pandey, Prabhat, et al.
Publicado: (2025)
por: Pandey, Prabhat, et al.
Publicado: (2025)
Unlocking Fine-Grained Translation Quality Estimation in LRMs through Synergistically Evolving Implicit and Explicit Reasoning
por: Dang, Renfei, et al.
Publicado: (2026)
por: Dang, Renfei, et al.
Publicado: (2026)
"Knowing When You Don't Know": A Multilingual Relevance Assessment Dataset for Robust Retrieval-Augmented Generation
por: Thakur, Nandan, et al.
Publicado: (2023)
por: Thakur, Nandan, et al.
Publicado: (2023)
Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
por: Singh, Shivalika, et al.
Publicado: (2024)
por: Singh, Shivalika, et al.
Publicado: (2024)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
por: Lu, Yiting, et al.
Publicado: (2025)
por: Lu, Yiting, et al.
Publicado: (2025)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
por: Chen, Yijie, et al.
Publicado: (2026)
por: Chen, Yijie, et al.
Publicado: (2026)
sPhinX: Sample Efficient Multilingual Instruction Fine-Tuning Through N-shot Guided Prompting
por: Ahuja, Sanchit, et al.
Publicado: (2024)
por: Ahuja, Sanchit, et al.
Publicado: (2024)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
por: Lu, Ning, et al.
Publicado: (2025)
por: Lu, Ning, et al.
Publicado: (2025)
An Economic Analysis of Electricity Consumption and Electric Vehicle Adoption in California from 2010 to 2021
por: Qi, Pufan
Publicado: (2025)
por: Qi, Pufan
Publicado: (2025)
RAG-Instruct: Boosting LLMs with Diverse Retrieval-Augmented Instructions
por: Liu, Wanlong, et al.
Publicado: (2024)
por: Liu, Wanlong, et al.
Publicado: (2024)
Parrot: Multilingual Visual Instruction Tuning
por: Sun, Hai-Long, et al.
Publicado: (2024)
por: Sun, Hai-Long, et al.
Publicado: (2024)
D3: Diversity, Difficulty, and Dependability-Aware Data Selection for Sample-Efficient LLM Instruction Tuning
por: Zhang, Jia, et al.
Publicado: (2025)
por: Zhang, Jia, et al.
Publicado: (2025)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
por: Wang, Peiqi, et al.
Publicado: (2024)
por: Wang, Peiqi, et al.
Publicado: (2024)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
por: Ma, Xu, et al.
Publicado: (2026)
por: Ma, Xu, et al.
Publicado: (2026)
From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning
por: Li, Haoyu, et al.
Publicado: (2025)
por: Li, Haoyu, et al.
Publicado: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
por: Zhou, Shijie, et al.
Publicado: (2024)
por: Zhou, Shijie, et al.
Publicado: (2024)
Improving Multilingual Instruction Finetuning via Linguistically Natural and Diverse Datasets
por: Indurthi, Sathish Reddy, et al.
Publicado: (2024)
por: Indurthi, Sathish Reddy, et al.
Publicado: (2024)
GIFT: Guided Fine-Tuning and Transfer for Enhancing Instruction-Tuned Language Models
por: Ruan, Zhiwen, et al.
Publicado: (2026)
por: Ruan, Zhiwen, et al.
Publicado: (2026)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025)
por: Heuillet, Maxime, et al.
Publicado: (2025)
Mitigating Outlier Activations in Low-Precision Fine-Tuning of Language Models
por: Ghaffari, Alireza, et al.
Publicado: (2023)
por: Ghaffari, Alireza, et al.
Publicado: (2023)
Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation Refinement
por: Dong, Yichen, et al.
Publicado: (2025)
por: Dong, Yichen, et al.
Publicado: (2025)
Chain-of-Description: What I can understand, I can put into words
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
Multilingual Instruction Tuning With Just a Pinch of Multilinguality
por: Shaham, Uri, et al.
Publicado: (2024)
por: Shaham, Uri, et al.
Publicado: (2024)
Investigating Multilingual Instruction-Tuning: Do Polyglot Models Demand for Multilingual Instructions?
por: Weber, Alexander Arno, et al.
Publicado: (2024)
por: Weber, Alexander Arno, et al.
Publicado: (2024)
Ejemplares similares
-
MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis
por: Liu, Yilun, et al.
Publicado: (2025) -
C-Mining: Unsupervised Discovery of Seeds for Cultural Data Synthesis via Geometric Misalignment
por: Zeng, Pufan, et al.
Publicado: (2026) -
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
por: He, Minggui, et al.
Publicado: (2025) -
RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning
por: Xu, Song, et al.
Publicado: (2025) -
ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction
por: Yu, Yan, et al.
Publicado: (2025)