Enregistré dans:
| Auteurs principaux: | Subramanyam, Anirudh, Chen, Yuxin, Grossman, Robert L. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.03313 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pretraining Scaling Laws for Generative Evaluations of Language Models
par: Schaeffer, Rylan, et autres
Publié: (2025)
par: Schaeffer, Rylan, et autres
Publié: (2025)
Detecting Pretraining Data from Large Language Models
par: Shi, Weijia, et autres
Publié: (2023)
par: Shi, Weijia, et autres
Publié: (2023)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training
par: Sahoo, Subramanyam
Publié: (2025)
par: Sahoo, Subramanyam
Publié: (2025)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
par: Ge, Ce, et autres
Publié: (2024)
par: Ge, Ce, et autres
Publié: (2024)
The Double Life of Code World Models: Provably Unmasking Malicious Behavior Through Execution Traces
par: Sahoo, Subramanyam
Publié: (2025)
par: Sahoo, Subramanyam
Publié: (2025)
Scaling Laws for Mixture Pretraining Under Data Constraints
par: Sedova, Anastasiia, et autres
Publié: (2026)
par: Sedova, Anastasiia, et autres
Publié: (2026)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
par: Bethune, Louis, et autres
Publié: (2025)
par: Bethune, Louis, et autres
Publié: (2025)
Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining
par: Li, Houyi, et autres
Publié: (2025)
par: Li, Houyi, et autres
Publié: (2025)
Narrowing the Focus: Learned Optimizers for Pretrained Models
par: Kristiansen, Gus, et autres
Publié: (2024)
par: Kristiansen, Gus, et autres
Publié: (2024)
Parallel Scaling Law for Language Models
par: Chen, Mouxiang, et autres
Publié: (2025)
par: Chen, Mouxiang, et autres
Publié: (2025)
The Data Efficiency Frontier of Financial Foundation Models: Scaling Laws from Continued Pretraining
par: Ponnock, Jesse
Publié: (2025)
par: Ponnock, Jesse
Publié: (2025)
Scaling Laws for Multilingual Language Models
par: He, Yifei, et autres
Publié: (2024)
par: He, Yifei, et autres
Publié: (2024)
LaB-RAG: Label Boosted Retrieval Augmented Generation for Radiology Report Generation
par: Song, Steven, et autres
Publié: (2024)
par: Song, Steven, et autres
Publié: (2024)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
par: Ali, Mehdi, et autres
Publié: (2025)
par: Ali, Mehdi, et autres
Publié: (2025)
Multimodal Cancer Modeling in the Age of Foundation Model Embeddings
par: Song, Steven, et autres
Publié: (2025)
par: Song, Steven, et autres
Publié: (2025)
GDC Cohort Copilot: An AI Copilot for Curating Cohorts from the Genomic Data Commons
par: Song, Steven, et autres
Publié: (2025)
par: Song, Steven, et autres
Publié: (2025)
Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs
par: Chen, Zhengyu, et autres
Publié: (2025)
par: Chen, Zhengyu, et autres
Publié: (2025)
Parcae: Scaling Laws For Stable Looped Language Models
par: Prairie, Hayden, et autres
Publié: (2026)
par: Prairie, Hayden, et autres
Publié: (2026)
Scaling Laws for Differentially Private Language Models
par: McKenna, Ryan, et autres
Publié: (2025)
par: McKenna, Ryan, et autres
Publié: (2025)
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
par: Chen, Zhixun, et autres
Publié: (2025)
par: Chen, Zhixun, et autres
Publié: (2025)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
Keypoint Aware Masked Image Modelling
par: Krishna, Madhava, et autres
Publié: (2024)
par: Krishna, Madhava, et autres
Publié: (2024)
To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining
par: Singh, Karan, et autres
Publié: (2026)
par: Singh, Karan, et autres
Publié: (2026)
ProtoSSL: Interpretable Prototype Learning from Unlabeled Time-Series Data
par: Song, Steven, et autres
Publié: (2026)
par: Song, Steven, et autres
Publié: (2026)
Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
par: Portes, Jacob, et autres
Publié: (2025)
par: Portes, Jacob, et autres
Publié: (2025)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
par: Liew, Seng Pei, et autres
Publié: (2025)
par: Liew, Seng Pei, et autres
Publié: (2025)
Scaling Laws for Discriminative Classification in Large Language Models
par: Wyatte, Dean, et autres
Publié: (2024)
par: Wyatte, Dean, et autres
Publié: (2024)
Can Language Models Discover Scaling Laws?
par: Lin, Haowei, et autres
Publié: (2025)
par: Lin, Haowei, et autres
Publié: (2025)
QR-LoRA: QR-Based Low-Rank Adaptation for Efficient Fine-Tuning of Large Language Models
par: Liang, Jessica, et autres
Publié: (2025)
par: Liang, Jessica, et autres
Publié: (2025)
Revisiting Prompt Sensitivity in Large Language Models for Text Classification: The Role of Prompt Underspecification
par: Pecher, Branislav, et autres
Publié: (2026)
par: Pecher, Branislav, et autres
Publié: (2026)
Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
Procedural Pretraining: Warming Up Language Models with Abstract Data
par: Jiang, Liangze, et autres
Publié: (2026)
par: Jiang, Liangze, et autres
Publié: (2026)
ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
par: Longpre, Shayne, et autres
Publié: (2025)
par: Longpre, Shayne, et autres
Publié: (2025)
Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs
par: Sahoo, Subramanyam
Publié: (2026)
par: Sahoo, Subramanyam
Publié: (2026)
Scaling Laws of Global Weather Models
par: Yu, Yuejiang, et autres
Publié: (2026)
par: Yu, Yuejiang, et autres
Publié: (2026)
Scaling Laws for Post Training Quantized Large Language Models
par: Xu, Zifei, et autres
Publié: (2024)
par: Xu, Zifei, et autres
Publié: (2024)
Scaling Law for Language Models Training Considering Batch Size
par: Shuai, Xian, et autres
Publié: (2024)
par: Shuai, Xian, et autres
Publié: (2024)
Scaling Laws for Downstream Task Performance of Large Language Models
par: Isik, Berivan, et autres
Publié: (2024)
par: Isik, Berivan, et autres
Publié: (2024)
The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems
par: Sahoo, Subramanyam, et autres
Publié: (2025)
par: Sahoo, Subramanyam, et autres
Publié: (2025)
Documents similaires
-
Pretraining Scaling Laws for Generative Evaluations of Language Models
par: Schaeffer, Rylan, et autres
Publié: (2025) -
Detecting Pretraining Data from Large Language Models
par: Shi, Weijia, et autres
Publié: (2023) -
Revisiting Multilingual Data Mixtures in Language Model Pretraining
par: Foroutan, Negar, et autres
Publié: (2025) -
The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training
par: Sahoo, Subramanyam
Publié: (2025) -
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
par: Ge, Ce, et autres
Publié: (2024)