Reconciling Kaplan and Chinchilla Scaling Laws
Fuente:
arXiv
Salvato in:
| Autori principali: | Pearce, Tim, Song, Jinyeop |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
A Resource Model For Neural Scaling Law
di: Song, Jinyeop, et al.
Pubblicazione: (2024)
di: Song, Jinyeop, et al.
Pubblicazione: (2024)
Emergence and Effectiveness of Task Vectors in In-Context Learning: An Encoder Decoder Perspective
di: Han, Seungwook, et al.
Pubblicazione: (2024)
di: Han, Seungwook, et al.
Pubblicazione: (2024)
Problems with Chinchilla Approach 2: Systematic Biases in IsoFLOP Parabola Fits
di: Czech, Eric, et al.
Pubblicazione: (2026)
di: Czech, Eric, et al.
Pubblicazione: (2026)
Scaling Laws for Multilingual Language Models
di: He, Yifei, et al.
Pubblicazione: (2024)
di: He, Yifei, et al.
Pubblicazione: (2024)
Scaling Laws for Precision
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
Scaling Laws For Mixed Quantization
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
Neural Neural Scaling Laws
di: Hu, Michael Y., et al.
Pubblicazione: (2026)
di: Hu, Michael Y., et al.
Pubblicazione: (2026)
Unified Scaling Laws for Compressed Representations
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
di: Panferov, Andrei, et al.
Pubblicazione: (2025)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
Scaling Law for Quantization-Aware Training
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
Theoretical Foundations of Scaling Law in Familial Models
di: Song, Huan, et al.
Pubblicazione: (2025)
di: Song, Huan, et al.
Pubblicazione: (2025)
gzip Predicts Data-dependent Scaling Laws
di: Pandey, Rohan
Pubblicazione: (2024)
di: Pandey, Rohan
Pubblicazione: (2024)
Unraveling the Mystery of Scaling Laws: Part I
di: Su, Hui, et al.
Pubblicazione: (2024)
di: Su, Hui, et al.
Pubblicazione: (2024)
Prescriptive Scaling Laws for Data Constrained Training
di: Lovelace, Justin, et al.
Pubblicazione: (2026)
di: Lovelace, Justin, et al.
Pubblicazione: (2026)
Kinetics: Rethinking Test-Time Scaling Laws
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2025)
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2025)
Compression Scaling Laws:Unifying Sparsity and Quantization
di: Frantar, Elias, et al.
Pubblicazione: (2025)
di: Frantar, Elias, et al.
Pubblicazione: (2025)
Scaling Laws for Discriminative Classification in Large Language Models
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
Scaling Laws for Mixture Pretraining Under Data Constraints
di: Sedova, Anastasiia, et al.
Pubblicazione: (2026)
di: Sedova, Anastasiia, et al.
Pubblicazione: (2026)
Zero-Shot Performance Prediction for Probabilistic Scaling Laws
di: Schram, Viktoria, et al.
Pubblicazione: (2025)
di: Schram, Viktoria, et al.
Pubblicazione: (2025)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
Predicting Task Performance with Context-aware Scaling Laws
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
di: Montgomery, Kyle, et al.
Pubblicazione: (2025)
Distillation Scaling Laws
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
di: Busbridge, Dan, et al.
Pubblicazione: (2025)
Scaling Laws for Post Training Quantized Large Language Models
di: Xu, Zifei, et al.
Pubblicazione: (2024)
di: Xu, Zifei, et al.
Pubblicazione: (2024)
Scaling Law for Language Models Training Considering Batch Size
di: Shuai, Xian, et al.
Pubblicazione: (2024)
di: Shuai, Xian, et al.
Pubblicazione: (2024)
Scaling Laws for Downstream Task Performance of Large Language Models
di: Isik, Berivan, et al.
Pubblicazione: (2024)
di: Isik, Berivan, et al.
Pubblicazione: (2024)
Scaling Laws Are Unreliable for Downstream Tasks: A Reality Check
di: Lourie, Nicholas, et al.
Pubblicazione: (2025)
di: Lourie, Nicholas, et al.
Pubblicazione: (2025)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025)
di: Bethune, Louis, et al.
Pubblicazione: (2025)
What Scales in Cross-Entropy Scaling Law?
di: Yan, Junxi, et al.
Pubblicazione: (2025)
di: Yan, Junxi, et al.
Pubblicazione: (2025)
Exploring Scaling Laws for Local SGD in Large Language Model Training
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
How to Upscale Neural Networks with Scaling Law? A Survey and Practical Guidelines
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
di: Sengupta, Ayan, et al.
Pubblicazione: (2025)
Scaling Law with Learning Rate Annealing
di: Tissue, Howe, et al.
Pubblicazione: (2024)
di: Tissue, Howe, et al.
Pubblicazione: (2024)
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation
di: Spravil, Julian, et al.
Pubblicazione: (2025)
di: Spravil, Julian, et al.
Pubblicazione: (2025)
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
di: Longpre, Shayne, et al.
Pubblicazione: (2025)
di: Longpre, Shayne, et al.
Pubblicazione: (2025)
Scaling Laws for Predicting Downstream Performance in LLMs
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
di: Chen, Yangyi, et al.
Pubblicazione: (2024)
Scaling Laws for Fine-Grained Mixture of Experts
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
A Hitchhiker's Guide to Scaling Law Estimation
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
Scaling Laws for Floating Point Quantization Training
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
di: Sun, Xingwu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
di: Sardana, Nikhil, et al.
Pubblicazione: (2023) -
A Resource Model For Neural Scaling Law
di: Song, Jinyeop, et al.
Pubblicazione: (2024) -
Emergence and Effectiveness of Task Vectors in In-Context Learning: An Encoder Decoder Perspective
di: Han, Seungwook, et al.
Pubblicazione: (2024) -
Problems with Chinchilla Approach 2: Systematic Biases in IsoFLOP Parabola Fits
di: Czech, Eric, et al.
Pubblicazione: (2026) -
Scaling Laws for Multilingual Language Models
di: He, Yifei, et al.
Pubblicazione: (2024)