Scaling Law with Learning Rate Annealing
Fuente:
arXiv
Salvato in:
| Autori principali: | Tissue, Howe, Wang, Venus, Wang, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training
di: Zhang, Mozhi, et al.
Pubblicazione: (2025)
di: Zhang, Mozhi, et al.
Pubblicazione: (2025)
Learning Dynamics in Continual Pre-Training for Large Language Models
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
di: Wang, Xingjin, et al.
Pubblicazione: (2025)
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
di: Tang, Yang, et al.
Pubblicazione: (2025)
di: Tang, Yang, et al.
Pubblicazione: (2025)
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
Scaling Laws for Predicting Downstream Performance in LLMs
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
Unifying Learning Dynamics and Generalization in Transformers Scaling Law
di: Yang, Chiwun
Pubblicazione: (2025)
di: Yang, Chiwun
Pubblicazione: (2025)
Distillation Scaling Laws
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
Towards a Comprehensive Scaling Law of Mixture-of-Experts
di: Zhao, Guoliang, et al.
Pubblicazione: (2025)
di: Zhao, Guoliang, et al.
Pubblicazione: (2025)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
Predicting Task Performance with Context-aware Scaling Laws
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules
di: Luo, Kairong, et al.
Pubblicazione: (2025)
di: Luo, Kairong, et al.
Pubblicazione: (2025)
What Scales in Cross-Entropy Scaling Law?
di: Yan, Junxi, et al.
Pubblicazione: (2025)
di: Yan, Junxi, et al.
Pubblicazione: (2025)
Scaling Laws for Fine-Grained Mixture of Experts
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
A Hitchhiker's Guide to Scaling Law Estimation
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
Exploring Scaling Laws for EHR Foundation Models
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
di: Zhang, Sheng, et al.
Pubblicazione: (2025)
Theoretical Foundations of Scaling Law in Familial Models
di: Song, Huan, et al.
Pubblicazione: (2025)
di: Song, Huan, et al.
Pubblicazione: (2025)
Learning Rate Scaling across LoRA Ranks and Transfer to Full Finetuning
di: Chen, Nan, et al.
Pubblicazione: (2026)
di: Chen, Nan, et al.
Pubblicazione: (2026)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
di: Lin, Haowei, et al.
Pubblicazione: (2024)
di: Lin, Haowei, et al.
Pubblicazione: (2024)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Observational Scaling Laws and the Predictability of Language Model Performance
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
Relative-Based Scaling Law for Neural Language Models
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining
di: Singh, Karan, et al.
Pubblicazione: (2026)
di: Singh, Karan, et al.
Pubblicazione: (2026)
MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining
di: Wen, Bingbing, et al.
Pubblicazione: (2026)
di: Wen, Bingbing, et al.
Pubblicazione: (2026)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
di: Mayilvahanan, Prasanna, et al.
Pubblicazione: (2025)
Diversity of Transformer Layers: One Aspect of Parameter Scaling Laws
di: Kamigaito, Hidetaka, et al.
Pubblicazione: (2025)
di: Kamigaito, Hidetaka, et al.
Pubblicazione: (2025)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
A Tale of Tails: Model Collapse as a Change of Scaling Laws
di: Dohmatob, Elvis, et al.
Pubblicazione: (2024)
di: Dohmatob, Elvis, et al.
Pubblicazione: (2024)
Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
di: Yang, Bangji, et al.
Pubblicazione: (2026)
di: Yang, Bangji, et al.
Pubblicazione: (2026)
(Mis)Fitting: A Survey of Scaling Laws
di: Li, Margaret, et al.
Pubblicazione: (2025)
di: Li, Margaret, et al.
Pubblicazione: (2025)
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI
di: Yang, Chao, et al.
Pubblicazione: (2024)
di: Yang, Chao, et al.
Pubblicazione: (2024)
Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws
di: Allen-Zhu, Zeyuan, et al.
Pubblicazione: (2024)
di: Allen-Zhu, Zeyuan, et al.
Pubblicazione: (2024)
Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
di: Ludziejewski, Jan, et al.
Pubblicazione: (2025)
Features that Make a Difference: Leveraging Gradients for Improved Dictionary Learning
di: Olmo, Jeffrey, et al.
Pubblicazione: (2024)
di: Olmo, Jeffrey, et al.
Pubblicazione: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification
di: Zheng, Bo, et al.
Pubblicazione: (2026)
di: Zheng, Bo, et al.
Pubblicazione: (2026)
Power Lines: Scaling Laws for Weight Decay and Batch Size in LLM Pre-training
di: Bergsma, Shane, et al.
Pubblicazione: (2025)
di: Bergsma, Shane, et al.
Pubblicazione: (2025)
Scaling Laws for Many-Shot In-Context Learning with Self-Generated Annotations
di: Gu, Zhengyao, et al.
Pubblicazione: (2025)
di: Gu, Zhengyao, et al.
Pubblicazione: (2025)
OptScale: Probabilistic Optimality for Inference-time Scaling
di: Wang, Youkang, et al.
Pubblicazione: (2025)
di: Wang, Youkang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training
di: Zhang, Mozhi, et al.
Pubblicazione: (2025) -
Learning Dynamics in Continual Pre-Training for Large Language Models
di: Wang, Xingjin, et al.
Pubblicazione: (2025) -
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
di: Tang, Yang, et al.
Pubblicazione: (2025) -
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
di: Chen, Xiaodong, et al.
Pubblicazione: (2024) -
Scaling Laws for Predicting Downstream Performance in LLMs
di: Chen, Yangyi, et al.
Pubblicazione: (2024)