Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
Fuente:
arXiv
Salvato in:
| Autori principali: | Sardana, Nikhil, Portes, Jacob, Doubov, Sasha, Frankle, Jonathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse Upcycling: Inference Inefficient Finetuning
di: Doubov, Sasha, et al.
Pubblicazione: (2024)
di: Doubov, Sasha, et al.
Pubblicazione: (2024)
MosaicBERT: A Bidirectional Encoder Optimized for Fast Pretraining
di: Portes, Jacob, et al.
Pubblicazione: (2023)
di: Portes, Jacob, et al.
Pubblicazione: (2023)
Reconciling Kaplan and Chinchilla Scaling Laws
di: Pearce, Tim, et al.
Pubblicazione: (2024)
di: Pearce, Tim, et al.
Pubblicazione: (2024)
Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
di: Portes, Jacob, et al.
Pubblicazione: (2025)
di: Portes, Jacob, et al.
Pubblicazione: (2025)
Long Context RAG Performance of Large Language Models
di: Leng, Quinn, et al.
Pubblicazione: (2024)
di: Leng, Quinn, et al.
Pubblicazione: (2024)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
Scaling Laws for Multilingual Language Models
di: He, Yifei, et al.
Pubblicazione: (2024)
di: He, Yifei, et al.
Pubblicazione: (2024)
Sparse Layers are Critical to Scaling Looped Language Models
di: Lee, Ryan, et al.
Pubblicazione: (2026)
di: Lee, Ryan, et al.
Pubblicazione: (2026)
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
di: Fernandez, Jared, et al.
Pubblicazione: (2025)
di: Fernandez, Jared, et al.
Pubblicazione: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Does your data spark joy? Performance gains from domain upsampling at the end of training
di: Blakeney, Cody, et al.
Pubblicazione: (2024)
di: Blakeney, Cody, et al.
Pubblicazione: (2024)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
Scaling Laws for Discriminative Classification in Large Language Models
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
Scaling Beyond Masked Diffusion Language Models
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2026)
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2026)
Scaling Laws for Post Training Quantized Large Language Models
di: Xu, Zifei, et al.
Pubblicazione: (2024)
di: Xu, Zifei, et al.
Pubblicazione: (2024)
Scaling Law for Language Models Training Considering Batch Size
di: Shuai, Xian, et al.
Pubblicazione: (2024)
di: Shuai, Xian, et al.
Pubblicazione: (2024)
Scaling Laws for Downstream Task Performance of Large Language Models
di: Isik, Berivan, et al.
Pubblicazione: (2024)
di: Isik, Berivan, et al.
Pubblicazione: (2024)
Problems with Chinchilla Approach 2: Systematic Biases in IsoFLOP Parabola Fits
di: Czech, Eric, et al.
Pubblicazione: (2026)
di: Czech, Eric, et al.
Pubblicazione: (2026)
LoRA Learns Less and Forgets Less
di: Biderman, Dan, et al.
Pubblicazione: (2024)
di: Biderman, Dan, et al.
Pubblicazione: (2024)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
Exploring Scaling Laws for Local SGD in Large Language Model Training
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
di: He, Qiaozhi, et al.
Pubblicazione: (2024)
Resolving Discrepancies in Compute-Optimal Scaling of Language Models
di: Porian, Tomer, et al.
Pubblicazione: (2024)
di: Porian, Tomer, et al.
Pubblicazione: (2024)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
A Hitchhiker's Guide to Scaling Law Estimation
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
di: Choshen, Leshem, et al.
Pubblicazione: (2024)
Scaling Inference-Efficient Language Models
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
OptScale: Probabilistic Optimality for Inference-time Scaling
di: Wang, Youkang, et al.
Pubblicazione: (2025)
di: Wang, Youkang, et al.
Pubblicazione: (2025)
Relative-Based Scaling Law for Neural Language Models
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
di: Yue, Baoqing, et al.
Pubblicazione: (2025)
Observational Scaling Laws and the Predictability of Language Model Performance
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
di: Ruan, Yangjun, et al.
Pubblicazione: (2024)
Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
di: Wang, Youkang, et al.
Pubblicazione: (2026)
di: Wang, Youkang, et al.
Pubblicazione: (2026)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models
di: Schwethelm, Kristian, et al.
Pubblicazione: (2026)
di: Schwethelm, Kristian, et al.
Pubblicazione: (2026)
CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
Scaling Laws for Precision
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
di: Kumar, Tanishq, et al.
Pubblicazione: (2024)
Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
di: Song, Yuxuan, et al.
Pubblicazione: (2025)
di: Song, Yuxuan, et al.
Pubblicazione: (2025)
Performance Law of Large Language Models
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
di: Wu, Chuhan, et al.
Pubblicazione: (2024)
Scaling Laws For Mixed Quantization
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
di: Cao, Zeyu, et al.
Pubblicazione: (2024)
Neural Neural Scaling Laws
di: Hu, Michael Y., et al.
Pubblicazione: (2026)
di: Hu, Michael Y., et al.
Pubblicazione: (2026)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sparse Upcycling: Inference Inefficient Finetuning
di: Doubov, Sasha, et al.
Pubblicazione: (2024) -
MosaicBERT: A Bidirectional Encoder Optimized for Fast Pretraining
di: Portes, Jacob, et al.
Pubblicazione: (2023) -
Reconciling Kaplan and Chinchilla Scaling Laws
di: Pearce, Tim, et al.
Pubblicazione: (2024) -
Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
di: Portes, Jacob, et al.
Pubblicazione: (2025) -
Long Context RAG Performance of Large Language Models
di: Leng, Quinn, et al.
Pubblicazione: (2024)