Rethinking Data Mixing from the Perspective of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Yuanjian, Sun, Tianze, Xu, Changwei, Zhao, XinLong, Hao, Jianing, Chen, Ran, Liu, Yang, Xu, Ruijie, Chen, Stephen, Zhang, Guang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
by: Xu, Yuanjian, et al.
Published: (2026)
by: Xu, Yuanjian, et al.
Published: (2026)
Towards Efficient LLMs Annealing with Principled Sample Selection
by: Xu, Yuanjian, et al.
Published: (2026)
by: Xu, Yuanjian, et al.
Published: (2026)
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
by: Liu, Yajiao, et al.
Published: (2025)
by: Liu, Yajiao, et al.
Published: (2025)
Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective
by: Kou, Zhiqiang, et al.
Published: (2025)
by: Kou, Zhiqiang, et al.
Published: (2025)
Game-Theoretic Lens on LLM-based Multi-Agent Systems
by: Hao, Jianing, et al.
Published: (2026)
by: Hao, Jianing, et al.
Published: (2026)
FinRipple: Aligning Large Language Models with Financial Market for Event Ripple Effect Awareness
by: Xu, Yuanjian, et al.
Published: (2025)
by: Xu, Yuanjian, et al.
Published: (2025)
Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges
by: Ding, Bosheng, et al.
Published: (2024)
by: Ding, Bosheng, et al.
Published: (2024)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
by: Xu, Shilin, et al.
Published: (2025)
by: Xu, Shilin, et al.
Published: (2025)
HGAN-SDEs: Learning Neural Stochastic Differential Equations with Hermite-Guided Adversarial Training
by: Xu, Yuanjian, et al.
Published: (2025)
by: Xu, Yuanjian, et al.
Published: (2025)
Automatic Instruction Evolving for Large Language Models
by: Zeng, Weihao, et al.
Published: (2024)
by: Zeng, Weihao, et al.
Published: (2024)
LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts
by: Chen, Junhao, et al.
Published: (2025)
by: Chen, Junhao, et al.
Published: (2025)
Are Large Language Models a Good Replacement of Taxonomies?
by: Sun, Yushi, et al.
Published: (2024)
by: Sun, Yushi, et al.
Published: (2024)
Multi-Agent Causal Discovery Using Large Language Models
by: Le, Hao Duong, et al.
Published: (2024)
by: Le, Hao Duong, et al.
Published: (2024)
DLLMQuant: Quantizing Diffusion-based Large Language Models
by: Xu, Chen, et al.
Published: (2025)
by: Xu, Chen, et al.
Published: (2025)
CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis
by: Xu, Xinzhe, et al.
Published: (2025)
by: Xu, Xinzhe, et al.
Published: (2025)
Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
by: Zhou, Hongli, et al.
Published: (2025)
by: Zhou, Hongli, et al.
Published: (2025)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
by: He, Guoxiu, et al.
Published: (2025)
by: He, Guoxiu, et al.
Published: (2025)
Delta-CoMe: Training-Free Delta-Compression with Mixed-Precision for Large Language Models
by: Ping, Bowen, et al.
Published: (2024)
by: Ping, Bowen, et al.
Published: (2024)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
Rethinking Machine Unlearning for Large Language Models
by: Liu, Sijia, et al.
Published: (2024)
by: Liu, Sijia, et al.
Published: (2024)
Unveiling the Misuse Potential of Base Large Language Models via In-Context Learning
by: Wang, Xiao, et al.
Published: (2024)
by: Wang, Xiao, et al.
Published: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
by: Xu, Xin, et al.
Published: (2026)
by: Xu, Xin, et al.
Published: (2026)
Token-wise Influential Training Data Retrieval for Large Language Models
by: Lin, Huawei, et al.
Published: (2024)
by: Lin, Huawei, et al.
Published: (2024)
Contrastive Knowledge Transfer and Robust Optimization for Secure Alignment of Large Language Models
by: Zheng, Jiasen, et al.
Published: (2025)
by: Zheng, Jiasen, et al.
Published: (2025)
Can Large Language Models Match Tutoring System Adaptivity? A Benchmarking Study
by: Borchers, Conrad, et al.
Published: (2025)
by: Borchers, Conrad, et al.
Published: (2025)
Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective
by: Fang, Hao, et al.
Published: (2026)
by: Fang, Hao, et al.
Published: (2026)
Progressive Residual Warmup for Language Model Pretraining
by: Chen, Tianhao, et al.
Published: (2026)
by: Chen, Tianhao, et al.
Published: (2026)
LLaSA: Large Language and Structured Data Assistant
by: Xu, Yao, et al.
Published: (2024)
by: Xu, Yao, et al.
Published: (2024)
Spatial-Temporal Large Language Model for Traffic Prediction
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
LENS: Large Pre-trained Transformer for Exploring Financial Time Series Regularities
by: Xu, Yuanjian, et al.
Published: (2024)
by: Xu, Yuanjian, et al.
Published: (2024)
Rethinking LLM Ensembling from the Perspective of Mixture Models
by: Fu, Jiale, et al.
Published: (2026)
by: Fu, Jiale, et al.
Published: (2026)
Large Language Models for Generative Information Extraction: A Survey
by: Xu, Derong, et al.
Published: (2023)
by: Xu, Derong, et al.
Published: (2023)
Large Language Model based Situational Dialogues for Second Language Learning
by: Xu, Shuyao, et al.
Published: (2024)
by: Xu, Shuyao, et al.
Published: (2024)
Mitigating Hidden Confounding by Progressive Confounder Imputation via Large Language Models
by: Yang, Hao, et al.
Published: (2025)
by: Yang, Hao, et al.
Published: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
by: Liu, Qiyuan, et al.
Published: (2025)
by: Liu, Qiyuan, et al.
Published: (2025)
Deep Learning and Large Language Models for Audio and Text Analysis in Predicting Suicidal Acts in Chinese Psychological Support Hotlines
by: Chen, Yining, et al.
Published: (2024)
by: Chen, Yining, et al.
Published: (2024)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
by: Chen, Nan, et al.
Published: (2024)
by: Chen, Nan, et al.
Published: (2024)
Lens: Rethinking Multilingual Enhancement for Large Language Models
by: Zhao, Weixiang, et al.
Published: (2024)
by: Zhao, Weixiang, et al.
Published: (2024)
Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?
by: Li, Wenzhe, et al.
Published: (2025)
by: Li, Wenzhe, et al.
Published: (2025)
Robust and Scalable Model Editing for Large Language Models
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
Similar Items
-
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
by: Xu, Yuanjian, et al.
Published: (2026) -
Towards Efficient LLMs Annealing with Principled Sample Selection
by: Xu, Yuanjian, et al.
Published: (2026) -
Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives
by: Liu, Yajiao, et al.
Published: (2025) -
Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective
by: Kou, Zhiqiang, et al.
Published: (2025) -
Game-Theoretic Lens on LLM-based Multi-Agent Systems
by: Hao, Jianing, et al.
Published: (2026)