Resolving Discrepancies in Compute-Optimal Scaling of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Porian, Tomer, Wortsman, Mitchell, Jitsev, Jenia, Schmidt, Ludwig, Carmon, Yair |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
Language models scale reliably with over-training and on downstream tasks
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024)
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024)
Reproducible scaling laws for contrastive language-image learning
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
Project Alexandria: Towards Freeing Scientific Knowledge from Copyright Burdens via LLMs
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)
Large Scale Transfer Learning for Tabular Data via Language Modeling
di: Gardner, Josh, et al.
Pubblicazione: (2024)
di: Gardner, Josh, et al.
Pubblicazione: (2024)
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Dual Precision Quantization for Efficient and Accurate Deep Neural Networks Inference
di: Gafni, Tomer, et al.
Pubblicazione: (2025)
di: Gafni, Tomer, et al.
Pubblicazione: (2025)
Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining
di: Shechter, Mikey, et al.
Pubblicazione: (2025)
di: Shechter, Mikey, et al.
Pubblicazione: (2025)
Concept-Aware Batch Sampling Improves Language-Image Pretraining
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2025)
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2025)
An Analytical Model for Overparameterized Learning Under Class Imbalance
di: Mor, Eliav, et al.
Pubblicazione: (2025)
di: Mor, Eliav, et al.
Pubblicazione: (2025)
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
di: Snell, Charlie, et al.
Pubblicazione: (2024)
di: Snell, Charlie, et al.
Pubblicazione: (2024)
Test-Time Scaling Makes Overtraining Compute-Optimal
di: Roberts, Nicholas, et al.
Pubblicazione: (2026)
di: Roberts, Nicholas, et al.
Pubblicazione: (2026)
Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
di: Sardana, Nikhil, et al.
Pubblicazione: (2023)
The Fair Language Model Paradox
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
di: Nguyen, Huu, et al.
Pubblicazione: (2025)
di: Nguyen, Huu, et al.
Pubblicazione: (2025)
DataComp-LM: In search of the next generation of training sets for language models
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
di: Feng, Kehua, et al.
Pubblicazione: (2024)
di: Feng, Kehua, et al.
Pubblicazione: (2024)
Calibrating Language Models with Adaptive Temperature Scaling
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
Compute Optimal Scaling of Skills: Knowledge vs Reasoning
di: Roberts, Nicholas, et al.
Pubblicazione: (2025)
di: Roberts, Nicholas, et al.
Pubblicazione: (2025)
The Price of Adaptivity in Stochastic Convex Optimization
di: Carmon, Yair, et al.
Pubblicazione: (2024)
di: Carmon, Yair, et al.
Pubblicazione: (2024)
Making SGD Parameter-Free
di: Carmon, Yair, et al.
Pubblicazione: (2022)
di: Carmon, Yair, et al.
Pubblicazione: (2022)
Inference Scaling vs Reasoning: An Empirical Analysis of Compute-Optimal LLM Problem-Solving
di: AbdElhameed, Marwan, et al.
Pubblicazione: (2024)
di: AbdElhameed, Marwan, et al.
Pubblicazione: (2024)
Evaluating Large Language Models with fmeval
di: Schwöbel, Pola, et al.
Pubblicazione: (2024)
di: Schwöbel, Pola, et al.
Pubblicazione: (2024)
Word Sense Detection Leveraging Maximum Mean Discrepancy
di: Mitsuzawa, Kensuke
Pubblicazione: (2025)
di: Mitsuzawa, Kensuke
Pubblicazione: (2025)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
di: Nguyen, Thao, et al.
Pubblicazione: (2025)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
Scaling Laws for Multilingual Language Models
di: He, Yifei, et al.
Pubblicazione: (2024)
di: He, Yifei, et al.
Pubblicazione: (2024)
Scaling Embedding Layers in Language Models
di: Yu, Da, et al.
Pubblicazione: (2025)
di: Yu, Da, et al.
Pubblicazione: (2025)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations
di: Mitsuzawa, Kensuke, et al.
Pubblicazione: (2025)
di: Mitsuzawa, Kensuke, et al.
Pubblicazione: (2025)
Scaling Beyond Masked Diffusion Language Models
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2026)
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2026)
Reusing Overtrained Language Models Saturates Scaling
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
di: Liew, Seng Pei, et al.
Pubblicazione: (2025)
Kanana: Compute-efficient Bilingual Language Models
di: Kanana LLM Team, et al.
Pubblicazione: (2025)
di: Kanana LLM Team, et al.
Pubblicazione: (2025)
Margin Discrepancy-based Adversarial Training for Multi-Domain Text Classification
di: Wu, Yuan
Pubblicazione: (2024)
di: Wu, Yuan
Pubblicazione: (2024)
Optimal Splitting of Language Models from Mixtures to Specialized Domains
di: Seto, Skyler, et al.
Pubblicazione: (2026)
di: Seto, Skyler, et al.
Pubblicazione: (2026)
Pareto Optimal Learning for Estimating Large Language Model Errors
di: Zhao, Theodore, et al.
Pubblicazione: (2023)
di: Zhao, Theodore, et al.
Pubblicazione: (2023)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
Scaling Laws for Discriminative Classification in Large Language Models
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
Emergent Abilities in Reduced-Scale Generative Language Models
di: Muckatira, Sherin, et al.
Pubblicazione: (2024)
di: Muckatira, Sherin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025) -
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024) -
Language models scale reliably with over-training and on downstream tasks
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024) -
Reproducible scaling laws for contrastive language-image learning
di: Cherti, Mehdi, et al.
Pubblicazione: (2022) -
Project Alexandria: Towards Freeing Scientific Knowledge from Copyright Burdens via LLMs
di: Schuhmann, Christoph, et al.
Pubblicazione: (2025)