Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ye, Jiasheng, Liu, Peiju, Sun, Tianxiang, Zhan, Jun, Zhou, Yunhua, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training
von: Zhang, Mozhi, et al.
Veröffentlicht: (2025)
von: Zhang, Mozhi, et al.
Veröffentlicht: (2025)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
von: Peng, Runyu, et al.
Veröffentlicht: (2026)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
von: Zhan, Jun, et al.
Veröffentlicht: (2024)
von: Zhan, Jun, et al.
Veröffentlicht: (2024)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
von: Ge, Ce, et al.
Veröffentlicht: (2024)
von: Ge, Ce, et al.
Veröffentlicht: (2024)
BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments
von: Wang, Xinghao, et al.
Veröffentlicht: (2024)
von: Wang, Xinghao, et al.
Veröffentlicht: (2024)
Evolution of Concepts in Language Model Pre-Training
von: Ge, Xuyang, et al.
Veröffentlicht: (2025)
von: Ge, Xuyang, et al.
Veröffentlicht: (2025)
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
von: Wen, Bingbing, et al.
Veröffentlicht: (2026)
von: Wen, Bingbing, et al.
Veröffentlicht: (2026)
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
The Open-World Lottery Ticket Hypothesis for OOD Intent Classification
von: Zhou, Yunhua, et al.
Veröffentlicht: (2022)
von: Zhou, Yunhua, et al.
Veröffentlicht: (2022)
LLMSurgeon: Diagnosing Data Mixture of Large Language Models
von: Luo, Yaxin, et al.
Veröffentlicht: (2026)
von: Luo, Yaxin, et al.
Veröffentlicht: (2026)
Aioli: A Unified Optimization Framework for Language Model Data Mixing
von: Chen, Mayee F., et al.
Veröffentlicht: (2024)
von: Chen, Mayee F., et al.
Veröffentlicht: (2024)
Agent Alignment in Evolving Social Norms
von: Li, Shimin, et al.
Veröffentlicht: (2024)
von: Li, Shimin, et al.
Veröffentlicht: (2024)
Observational Scaling Laws and the Predictability of Language Model Performance
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
Rethinking Data Mixing from the Perspective of Large Language Models
von: Xu, Yuanjian, et al.
Veröffentlicht: (2026)
von: Xu, Yuanjian, et al.
Veröffentlicht: (2026)
Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning
von: Zhang, Yechen, et al.
Veröffentlicht: (2026)
von: Zhang, Yechen, et al.
Veröffentlicht: (2026)
Relative-Based Scaling Law for Neural Language Models
von: Yue, Baoqing, et al.
Veröffentlicht: (2025)
von: Yue, Baoqing, et al.
Veröffentlicht: (2025)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
von: Foroutan, Negar, et al.
Veröffentlicht: (2025)
von: Foroutan, Negar, et al.
Veröffentlicht: (2025)
Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction
von: Ye, Yuanchang, et al.
Veröffentlicht: (2025)
von: Ye, Yuanchang, et al.
Veröffentlicht: (2025)
RegMix: Data Mixture as Regression for Language Model Pre-training
von: Liu, Qian, et al.
Veröffentlicht: (2024)
von: Liu, Qian, et al.
Veröffentlicht: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
MergeMix: Optimizing Mid-Training Data Mixtures via Learnable Model Merging
von: Wang, Jiapeng, et al.
Veröffentlicht: (2026)
von: Wang, Jiapeng, et al.
Veröffentlicht: (2026)
Balanced Data Sampling for Language Model Training with Clustering
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
von: Shao, Yunfan, et al.
Veröffentlicht: (2024)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
von: Yang, Jinluan, et al.
Veröffentlicht: (2025)
von: Yang, Jinluan, et al.
Veröffentlicht: (2025)
Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization
von: Berasi, Davide, et al.
Veröffentlicht: (2026)
von: Berasi, Davide, et al.
Veröffentlicht: (2026)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
von: Wang, Bo, et al.
Veröffentlicht: (2025)
von: Wang, Bo, et al.
Veröffentlicht: (2025)
Efficient End-to-end Language Model Fine-tuning on Graphs
von: Xue, Rui, et al.
Veröffentlicht: (2023)
von: Xue, Rui, et al.
Veröffentlicht: (2023)
Towards a Comprehensive Scaling Law of Mixture-of-Experts
von: Zhao, Guoliang, et al.
Veröffentlicht: (2025)
von: Zhao, Guoliang, et al.
Veröffentlicht: (2025)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
Collaborative Performance Prediction for Large Language Models
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2024)
Scaling Laws for Predicting Downstream Performance in LLMs
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
von: Chen, Yangyi, et al.
Veröffentlicht: (2024)
A Law of Next-Token Prediction in Large Language Models
von: He, Hangfeng, et al.
Veröffentlicht: (2024)
von: He, Hangfeng, et al.
Veröffentlicht: (2024)
Diversity-oriented Data Augmentation with Large Language Models
von: Wang, Zaitian, et al.
Veröffentlicht: (2025)
von: Wang, Zaitian, et al.
Veröffentlicht: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
von: Zhang, Xiaotian, et al.
Veröffentlicht: (2023)
Towards the Law of Capacity Gap in Distilling Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
Mixture of Heterogeneous Grouped Experts for Language Modeling
von: Ma, Zhicheng, et al.
Veröffentlicht: (2026)
von: Ma, Zhicheng, et al.
Veröffentlicht: (2026)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
von: Liu, Peiju, et al.
Veröffentlicht: (2026)
von: Liu, Peiju, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025) -
Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training
von: Zhang, Mozhi, et al.
Veröffentlicht: (2025) -
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
von: Peng, Runyu, et al.
Veröffentlicht: (2026) -
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
von: Zhan, Jun, et al.
Veröffentlicht: (2024) -
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)