Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yajiao, Chen, Congliang, Yang, Junchi, Sun, Ruoyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models
by: Liu, Ziche, et al.
Published: (2024)
by: Liu, Ziche, et al.
Published: (2024)
Rethinking Data Mixing from the Perspective of Large Language Models
by: Xu, Yuanjian, et al.
Published: (2026)
by: Xu, Yuanjian, et al.
Published: (2026)
Rethinking LLM Ensembling from the Perspective of Mixture Models
by: Fu, Jiale, et al.
Published: (2026)
by: Fu, Jiale, et al.
Published: (2026)
Datasets for Large Language Models: A Comprehensive Survey
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
by: Wei, Fangyun, et al.
Published: (2024)
by: Wei, Fangyun, et al.
Published: (2024)
A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
by: Xiao, Hanguang, et al.
Published: (2024)
by: Xiao, Hanguang, et al.
Published: (2024)
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
by: Yao, Junchi, et al.
Published: (2025)
by: Yao, Junchi, et al.
Published: (2025)
Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey
by: Dang, Yunkai, et al.
Published: (2024)
by: Dang, Yunkai, et al.
Published: (2024)
Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
A Survey on Mixture of Experts in Large Language Models
by: Cai, Weilin, et al.
Published: (2024)
by: Cai, Weilin, et al.
Published: (2024)
Large Language Models Hallucination: A Comprehensive Survey
by: Alansari, Aisha, et al.
Published: (2025)
by: Alansari, Aisha, et al.
Published: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
by: Li, Jindong, et al.
Published: (2025)
by: Li, Jindong, et al.
Published: (2025)
Large Language Models on Graphs: A Comprehensive Survey
by: Jin, Bowen, et al.
Published: (2023)
by: Jin, Bowen, et al.
Published: (2023)
Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?
by: Li, Wenzhe, et al.
Published: (2025)
by: Li, Wenzhe, et al.
Published: (2025)
Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective
by: Kou, Zhiqiang, et al.
Published: (2025)
by: Kou, Zhiqiang, et al.
Published: (2025)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
by: Ravaut, Mathieu, et al.
Published: (2024)
by: Ravaut, Mathieu, et al.
Published: (2024)
Large Language Models for Planning: A Comprehensive and Systematic Survey
by: Cao, Pengfei, et al.
Published: (2025)
by: Cao, Pengfei, et al.
Published: (2025)
A Survey on Efficient Large Language Model Training: From Data-centric Perspectives
by: Luo, Junyu, et al.
Published: (2025)
by: Luo, Junyu, et al.
Published: (2025)
A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry
by: Huang, Yining, et al.
Published: (2024)
by: Huang, Yining, et al.
Published: (2024)
A Survey on Medical Large Language Models: Technology, Application, Trustworthiness, and Future Directions
by: Liu, Lei, et al.
Published: (2024)
by: Liu, Lei, et al.
Published: (2024)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
by: Xia, Heming, et al.
Published: (2024)
by: Xia, Heming, et al.
Published: (2024)
SLANG: New Concept Comprehension of Large Language Models
by: Mei, Lingrui, et al.
Published: (2024)
by: Mei, Lingrui, et al.
Published: (2024)
Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities
by: Chai, Yaping, et al.
Published: (2025)
by: Chai, Yaping, et al.
Published: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
by: Wang, Peng-Yuan, et al.
Published: (2026)
by: Wang, Peng-Yuan, et al.
Published: (2026)
A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery
by: Zhang, Yu, et al.
Published: (2024)
by: Zhang, Yu, et al.
Published: (2024)
Advancing Graph Representation Learning with Large Language Models: A Comprehensive Survey of Techniques
by: Mao, Qiheng, et al.
Published: (2024)
by: Mao, Qiheng, et al.
Published: (2024)
Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models
by: Li, Chaozhuo, et al.
Published: (2025)
by: Li, Chaozhuo, et al.
Published: (2025)
Protein Large Language Models: A Comprehensive Survey
by: Xiao, Yijia, et al.
Published: (2025)
by: Xiao, Yijia, et al.
Published: (2025)
A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models
by: Tonmoy, S. M Towhidul Islam, et al.
Published: (2024)
by: Tonmoy, S. M Towhidul Islam, et al.
Published: (2024)
A Survey on Large Language Model Benchmarks
by: Ni, Shiwen, et al.
Published: (2025)
by: Ni, Shiwen, et al.
Published: (2025)
Rethinking Sparse Mixture of Experts from a Unified Perspective
by: Do, Giang, et al.
Published: (2025)
by: Do, Giang, et al.
Published: (2025)
A Survey on Data Synthesis and Augmentation for Large Language Models
by: Wang, Ke, et al.
Published: (2024)
by: Wang, Ke, et al.
Published: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
by: He, Guoxiu, et al.
Published: (2025)
by: He, Guoxiu, et al.
Published: (2025)
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
by: Gan, Aoran, et al.
Published: (2025)
by: Gan, Aoran, et al.
Published: (2025)
A Comprehensive Survey on Integrating Large Language Models with Knowledge-Based Methods
by: Yang, Wenli, et al.
Published: (2025)
by: Yang, Wenli, et al.
Published: (2025)
A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models
by: Geng, Jiahui, et al.
Published: (2025)
by: Geng, Jiahui, et al.
Published: (2025)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
by: Aljohani, Manar, et al.
Published: (2025)
by: Aljohani, Manar, et al.
Published: (2025)
Large Language Models in Politics and Democracy: A Comprehensive Survey
by: Aoki, Goshi
Published: (2024)
by: Aoki, Goshi
Published: (2024)
Data Distribution Matters: A Data-Centric Perspective on Context Compression for Large Language Model
by: Lv, Kangtao, et al.
Published: (2026)
by: Lv, Kangtao, et al.
Published: (2026)
Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting
by: Xu, Bowen, et al.
Published: (2024)
by: Xu, Bowen, et al.
Published: (2024)
Similar Items
-
Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models
by: Liu, Ziche, et al.
Published: (2024) -
Rethinking Data Mixing from the Perspective of Large Language Models
by: Xu, Yuanjian, et al.
Published: (2026) -
Rethinking LLM Ensembling from the Perspective of Mixture Models
by: Fu, Jiale, et al.
Published: (2026) -
Datasets for Large Language Models: A Comprehensive Survey
by: Liu, Yang, et al.
Published: (2024) -
Rethinking Generative Large Language Model Evaluation for Semantic Comprehension
by: Wei, Fangyun, et al.
Published: (2024)