Scaling Law for Language Models Training Considering Batch Size
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shuai, Xian, Wang, Yiding, Wu, Yimeng, Jiang, Xin, Ren, Xiaozhe |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scaling Laws for Post Training Quantized Large Language Models
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
von: Xu, Zifei, et al.
Veröffentlicht: (2024)
Exploring Scaling Laws for Local SGD in Large Language Model Training
von: He, Qiaozhi, et al.
Veröffentlicht: (2024)
von: He, Qiaozhi, et al.
Veröffentlicht: (2024)
Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
von: Bergsma, Shane, et al.
Veröffentlicht: (2025)
von: Bergsma, Shane, et al.
Veröffentlicht: (2025)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
von: Chen, Guoxuan, et al.
Veröffentlicht: (2024)
von: Chen, Guoxuan, et al.
Veröffentlicht: (2024)
Scaling Laws for Floating Point Quantization Training
von: Sun, Xingwu, et al.
Veröffentlicht: (2025)
von: Sun, Xingwu, et al.
Veröffentlicht: (2025)
Scaling Laws for Multilingual Language Models
von: He, Yifei, et al.
Veröffentlicht: (2024)
von: He, Yifei, et al.
Veröffentlicht: (2024)
Parallel Scaling Law for Language Models
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
von: Chen, Mouxiang, et al.
Veröffentlicht: (2025)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
Scaling Law for Quantization-Aware Training
von: Chen, Mengzhao, et al.
Veröffentlicht: (2025)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2025)
Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
von: Yang, Bangji, et al.
Veröffentlicht: (2026)
von: Yang, Bangji, et al.
Veröffentlicht: (2026)
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
von: Chen, Xiaodong, et al.
Veröffentlicht: (2024)
von: Chen, Xiaodong, et al.
Veröffentlicht: (2024)
Prescriptive Scaling Laws for Data Constrained Training
von: Lovelace, Justin, et al.
Veröffentlicht: (2026)
von: Lovelace, Justin, et al.
Veröffentlicht: (2026)
Scaling Laws for Discriminative Classification in Large Language Models
von: Wyatte, Dean, et al.
Veröffentlicht: (2024)
von: Wyatte, Dean, et al.
Veröffentlicht: (2024)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
von: Liew, Seng Pei, et al.
Veröffentlicht: (2025)
Performance Law of Large Language Models
von: Wu, Chuhan, et al.
Veröffentlicht: (2024)
von: Wu, Chuhan, et al.
Veröffentlicht: (2024)
Scaling Laws for Downstream Task Performance of Large Language Models
von: Isik, Berivan, et al.
Veröffentlicht: (2024)
von: Isik, Berivan, et al.
Veröffentlicht: (2024)
Can Language Models Discover Scaling Laws?
von: Lin, Haowei, et al.
Veröffentlicht: (2025)
von: Lin, Haowei, et al.
Veröffentlicht: (2025)
Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo
von: Charles, Zachary, et al.
Veröffentlicht: (2025)
von: Charles, Zachary, et al.
Veröffentlicht: (2025)
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
von: Sardana, Nikhil, et al.
Veröffentlicht: (2023)
von: Sardana, Nikhil, et al.
Veröffentlicht: (2023)
RedPajama: an Open Dataset for Training Large Language Models
von: Weber, Maurice, et al.
Veröffentlicht: (2024)
von: Weber, Maurice, et al.
Veröffentlicht: (2024)
Observational Scaling Laws and the Predictability of Language Model Performance
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
von: Ruan, Yangjun, et al.
Veröffentlicht: (2024)
Relative-Based Scaling Law for Neural Language Models
von: Yue, Baoqing, et al.
Veröffentlicht: (2025)
von: Yue, Baoqing, et al.
Veröffentlicht: (2025)
Scaling Context, Not Parameters: Training a Compact 7B Language Model for Efficient Long-Context Processing
von: Wu, Chen, et al.
Veröffentlicht: (2025)
von: Wu, Chen, et al.
Veröffentlicht: (2025)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Training Language Models with Language Feedback at Scale
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
von: Scheurer, Jérémy, et al.
Veröffentlicht: (2023)
CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
von: Gu, Jiawei, et al.
Veröffentlicht: (2024)
von: Gu, Jiawei, et al.
Veröffentlicht: (2024)
How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models
von: Schwethelm, Kristian, et al.
Veröffentlicht: (2026)
von: Schwethelm, Kristian, et al.
Veröffentlicht: (2026)
CarbonScaling: Extending Neural Scaling Laws for Carbon Footprint in Large Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
Scaling Laws for Precision
von: Kumar, Tanishq, et al.
Veröffentlicht: (2024)
von: Kumar, Tanishq, et al.
Veröffentlicht: (2024)
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
von: Yoon, Junsang, et al.
Veröffentlicht: (2024)
von: Yoon, Junsang, et al.
Veröffentlicht: (2024)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training
von: Liu, Lei, et al.
Veröffentlicht: (2025)
von: Liu, Lei, et al.
Veröffentlicht: (2025)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
Joint Selection for Large-Scale Pre-Training Data via Policy Gradient-based Mask Learning
von: Fan, Ziqing, et al.
Veröffentlicht: (2025)
von: Fan, Ziqing, et al.
Veröffentlicht: (2025)
Scaling Laws For Mixed Quantization
von: Cao, Zeyu, et al.
Veröffentlicht: (2024)
von: Cao, Zeyu, et al.
Veröffentlicht: (2024)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
von: Chen, Yanxi, et al.
Veröffentlicht: (2024)
von: Chen, Yanxi, et al.
Veröffentlicht: (2024)
Sliding Window Attention Training for Efficient Large Language Models
von: Fu, Zichuan, et al.
Veröffentlicht: (2025)
von: Fu, Zichuan, et al.
Veröffentlicht: (2025)
Neural Neural Scaling Laws
von: Hu, Michael Y., et al.
Veröffentlicht: (2026)
von: Hu, Michael Y., et al.
Veröffentlicht: (2026)
Linear Dynamics in the RLVR Training of Large Language Models
von: Wang, Tianle, et al.
Veröffentlicht: (2026)
von: Wang, Tianle, et al.
Veröffentlicht: (2026)
Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens
von: Ouyang, Xu, et al.
Veröffentlicht: (2024)
von: Ouyang, Xu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Scaling Laws for Post Training Quantized Large Language Models
von: Xu, Zifei, et al.
Veröffentlicht: (2024) -
Exploring Scaling Laws for Local SGD in Large Language Model Training
von: He, Qiaozhi, et al.
Veröffentlicht: (2024) -
Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
von: Bergsma, Shane, et al.
Veröffentlicht: (2025) -
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
von: Chen, Guoxuan, et al.
Veröffentlicht: (2024) -
Scaling Laws for Floating Point Quantization Training
von: Sun, Xingwu, et al.
Veröffentlicht: (2025)