Language models scale reliably with over-training and on downstream tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Gadre, Samir Yitzhak, Smyrnis, Georgios, Shankar, Vaishaal, Gururangan, Suchin, Wortsman, Mitchell, Shao, Rulin, Mercat, Jean, Fang, Alex, Li, Jeffrey, Keh, Sedrick, Xin, Rui, Nezhurina, Marianna, Vasiljevic, Igor, Jitsev, Jenia, Soldaini, Luca, Dimakis, Alexandros G., Ilharco, Gabriel, Koh, Pang Wei, Song, Shuran, Kollar, Thomas, Carmon, Yair, Dave, Achal, Heckel, Reinhard, Muennighoff, Niklas, Schmidt, Ludwig |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Should VLMs be Pre-trained with Image Data?
di: Keh, Sedrick, et al.
Pubblicazione: (2025)
di: Keh, Sedrick, et al.
Pubblicazione: (2025)
Linearizing Large Language Models
di: Mercat, Jean, et al.
Pubblicazione: (2024)
di: Mercat, Jean, et al.
Pubblicazione: (2024)
Resolving Discrepancies in Compute-Optimal Scaling of Language Models
di: Porian, Tomer, et al.
Pubblicazione: (2024)
di: Porian, Tomer, et al.
Pubblicazione: (2024)
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025)
DataComp-LM: In search of the next generation of training sets for language models
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2024)
Reproducible scaling laws for contrastive language-image learning
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
di: Cherti, Mehdi, et al.
Pubblicazione: (2022)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Learning in Compact Spaces with Approximately Normalized Transformer
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
di: Franke, Jörg K. H., et al.
Pubblicazione: (2025)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024)
di: Sharma, Archit, et al.
Pubblicazione: (2024)
Time is Encoded in the Weights of Finetuned Language Models
di: Nylund, Kai, et al.
Pubblicazione: (2023)
di: Nylund, Kai, et al.
Pubblicazione: (2023)
AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters
di: Lucy, Li, et al.
Pubblicazione: (2024)
di: Lucy, Li, et al.
Pubblicazione: (2024)
Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
di: Mercat, Jean, et al.
Pubblicazione: (2026)
di: Mercat, Jean, et al.
Pubblicazione: (2026)
AudioToolAgent: An Agentic Framework for Audio-Language Models
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
OpenThoughts: Data Recipes for Reasoning Models
di: Guha, Etash, et al.
Pubblicazione: (2025)
di: Guha, Etash, et al.
Pubblicazione: (2025)
LESS: Selecting Influential Data for Targeted Instruction Tuning
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2024)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2024)
Understanding Complexity in VideoQA via Visual Program Generation
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
SkillFactory: Self-Distillation For Learning Cognitive Behaviors
di: Sprague, Zayne, et al.
Pubblicazione: (2025)
di: Sprague, Zayne, et al.
Pubblicazione: (2025)
A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
Coboundaries and eigenvalues of morphic subshifts
di: Mercat, Paul
Pubblicazione: (2024)
di: Mercat, Paul
Pubblicazione: (2024)
Geometrical representation of subshifts for primitive substitutions
di: Mercat, Paul
Pubblicazione: (2022)
di: Mercat, Paul
Pubblicazione: (2022)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
di: Blevins, Terra, et al.
Pubblicazione: (2024)
di: Blevins, Terra, et al.
Pubblicazione: (2024)
Historia de los judíos en la España cristiana / Yitzhak Baer ; traducida del hebreo por José Luis Lacave
di: Baer, Yitzhak
Pubblicazione: (1981)
di: Baer, Yitzhak
Pubblicazione: (1981)
The Shi'Ites and the future of Iraq / Yitzhak Nakash
di: Nakash, Yitzhak
Pubblicazione: (2003)
di: Nakash, Yitzhak
Pubblicazione: (2003)
Vasijas conectadas: Asia Occidental y Asia Oriental en la Geopolítica de China
di: Yitzhak Shichor
Pubblicazione: (2016)
di: Yitzhak Shichor
Pubblicazione: (2016)
Knowledge Transfer in Social Work: The Role of Grey Documentation.
di: Berman, Yitzhak
Pubblicazione: (1995)
di: Berman, Yitzhak
Pubblicazione: (1995)
Out of Proportion: Israel's Paradox In China's Middle Eastern Policy
di: Yitzhak Shichor
Pubblicazione: (2025)
di: Yitzhak Shichor
Pubblicazione: (2025)
Educación y construcción nacional en Israel
di: Yitzhak Kashti
Pubblicazione: (2000)
di: Yitzhak Kashti
Pubblicazione: (2000)
Inverse Deep Learning Ray Tracing for Heliostat Surface Prediction
di: Lewen, Jan, et al.
Pubblicazione: (2024)
di: Lewen, Jan, et al.
Pubblicazione: (2024)
Scalable heliostat surface predictions from focal spots: Sim-to-Real transfer of inverse Deep Learning Raytracing
di: Lewen, Jan, et al.
Pubblicazione: (2025)
di: Lewen, Jan, et al.
Pubblicazione: (2025)
Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
di: Jayalath, Dulhan, et al.
Pubblicazione: (2025)
di: Jayalath, Dulhan, et al.
Pubblicazione: (2025)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Discrimination at Work
di: Mercat-Bruns, Marie
Pubblicazione: (2020)
di: Mercat-Bruns, Marie
Pubblicazione: (2020)
Discrimination at Work: Comparing European, French, and American Law
di: Mercat-Bruns, Marie
Pubblicazione: (2016)
di: Mercat-Bruns, Marie
Pubblicazione: (2016)
Analytically generated sharply o-minimal structures
di: Carmon, Oded
Pubblicazione: (2026)
di: Carmon, Oded
Pubblicazione: (2026)
Scattering amplitudes of stable curves
di: Tevelev, Jenia
Pubblicazione: (2020)
di: Tevelev, Jenia
Pubblicazione: (2020)
Rethinking Thinking Tokens: LLMs as Improvement Operators
di: Madaan, Lovish, et al.
Pubblicazione: (2025)
di: Madaan, Lovish, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Should VLMs be Pre-trained with Image Data?
di: Keh, Sedrick, et al.
Pubblicazione: (2025) -
Linearizing Large Language Models
di: Mercat, Jean, et al.
Pubblicazione: (2024) -
Resolving Discrepancies in Compute-Optimal Scaling of Language Models
di: Porian, Tomer, et al.
Pubblicazione: (2024) -
Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play
di: Cipolina-Kun, Lucia, et al.
Pubblicazione: (2025) -
DataComp-LM: In search of the next generation of training sets for language models
di: Li, Jeffrey, et al.
Pubblicazione: (2024)