CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gu, Jiawei, Yang, Zacc, Ding, Chuanghao, Zhao, Rui, Tan, Fei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training
von: Liu, Lei, et al.
Veröffentlicht: (2025)
von: Liu, Lei, et al.
Veröffentlicht: (2025)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
Making Pre-trained Language Models Great on Tabular Prediction
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
Investigating Data Contamination for Pre-training Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
Efficient Continual Pre-training of LLMs for Low-resource Languages
von: Nag, Arijit, et al.
Veröffentlicht: (2024)
von: Nag, Arijit, et al.
Veröffentlicht: (2024)
Scaling Laws for Multilingual Language Models
von: He, Yifei, et al.
Veröffentlicht: (2024)
von: He, Yifei, et al.
Veröffentlicht: (2024)
Parallel Scaling Law for Language Models
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
von: Ibrahim, Adam, et al.
Veröffentlicht: (2024)
von: Ibrahim, Adam, et al.
Veröffentlicht: (2024)
The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws
von: Jin, Tian, et al.
Veröffentlicht: (2025)
von: Jin, Tian, et al.
Veröffentlicht: (2025)
Evaluating the Effectiveness of Pre-trained Language Models in Predicting the Helpfulness of Online Product Reviews
von: Boluki, Ali, et al.
Veröffentlicht: (2023)
von: Boluki, Ali, et al.
Veröffentlicht: (2023)
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
von: Ye, Jiasheng, et al.
Veröffentlicht: (2024)
von: Ye, Jiasheng, et al.
Veröffentlicht: (2024)
Towards a Comprehensive Scaling Law of Mixture-of-Experts
von: Zhao, Guoliang, et al.
Veröffentlicht: (2025)
von: Zhao, Guoliang, et al.
Veröffentlicht: (2025)
Model Merging in Pre-training of Large Language Models
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
von: Zhu, Rui-Jie, et al.
Veröffentlicht: (2023)
von: Zhu, Rui-Jie, et al.
Veröffentlicht: (2023)
Observational Scaling Laws and the Predictability of Language Model Performance
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
Scaling Laws for Mixture Pretraining Under Data Constraints
von: Sedova, Anastasiia, et al.
Veröffentlicht: (2026)
von: Sedova, Anastasiia, et al.
Veröffentlicht: (2026)
Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
von: Bergsma, Shane, et al.
Veröffentlicht: (2025)
von: Bergsma, Shane, et al.
Veröffentlicht: (2025)
Theoretical Foundations of Scaling Law in Familial Models
von: Song, Huan, et al.
Veröffentlicht: (2025)
von: Song, Huan, et al.
Veröffentlicht: (2025)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
DEPT: Decoupled Embeddings for Pre-training Language Models
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
von: Samragh, Mohammad, et al.
Veröffentlicht: (2024)
von: Samragh, Mohammad, et al.
Veröffentlicht: (2024)
Scaling Laws For Mixed Quantization
von: Cao, Zeyu, et al.
Veröffentlicht: (2024)
von: Cao, Zeyu, et al.
Veröffentlicht: (2024)
Scaling Laws for Fine-Grained Mixture of Experts
von: Krajewski, Jakub, et al.
Veröffentlicht: (2024)
von: Krajewski, Jakub, et al.
Veröffentlicht: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
von: Chung, Woojin, et al.
Veröffentlicht: (2025)
von: Chung, Woojin, et al.
Veröffentlicht: (2025)
Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
von: Kang, Feiyang, et al.
Veröffentlicht: (2025)
von: Kang, Feiyang, et al.
Veröffentlicht: (2025)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
von: Joshi, Raviraj, et al.
Veröffentlicht: (2024)
von: Joshi, Raviraj, et al.
Veröffentlicht: (2024)
nanoLM: an Affordable LLM Pre-training Benchmark via Accurate Loss Prediction across Scales
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
von: Yao, Yiqun, et al.
Veröffentlicht: (2023)
Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models
von: Belenki, Lior, et al.
Veröffentlicht: (2025)
von: Belenki, Lior, et al.
Veröffentlicht: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
von: Song, Weixi, et al.
Veröffentlicht: (2023)
von: Song, Weixi, et al.
Veröffentlicht: (2023)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
von: Chen, Yanxi, et al.
Veröffentlicht: (2024)
von: Chen, Yanxi, et al.
Veröffentlicht: (2024)
PaPaformer: Language Model from Pre-trained Parallel Paths
von: Tapaninaho, Joonas, et al.
Veröffentlicht: (2025)
von: Tapaninaho, Joonas, et al.
Veröffentlicht: (2025)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
Scaling Laws for Discriminative Classification in Large Language Models
von: Wyatte, Dean, et al.
Veröffentlicht: (2024)
von: Wyatte, Dean, et al.
Veröffentlicht: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code
von: Nakamura, Taishi, et al.
Veröffentlicht: (2024)
von: Nakamura, Taishi, et al.
Veröffentlicht: (2024)
Thinking Augmented Pre-training
von: Wang, Liang, et al.
Veröffentlicht: (2025)
von: Wang, Liang, et al.
Veröffentlicht: (2025)
Aligning Pre-trained Models for Spoken Language Translation
von: Sedláček, Šimon, et al.
Veröffentlicht: (2024)
von: Sedláček, Šimon, et al.
Veröffentlicht: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
von: Araujo, Vladimir, et al.
Veröffentlicht: (2023)
von: Araujo, Vladimir, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training
von: Liu, Lei, et al.
Veröffentlicht: (2025) -
Scaling Laws for Upcycling Mixture-of-Experts Language Models
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025) -
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024) -
Making Pre-trained Language Models Great on Tabular Prediction
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024) -
Investigating Data Contamination for Pre-training Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)