Enregistré dans:
| Auteurs principaux: | Kuo, Kevin, Setlur, Amrith, Srinivas, Kartik, Raghunathan, Aditi, Smith, Virginia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.04626 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multitask Learning Can Improve Worst-Group Outcomes
par: Kulkarni, Atharva, et autres
Publié: (2023)
par: Kulkarni, Atharva, et autres
Publié: (2023)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
par: Setlur, Amrith, et autres
Publié: (2024)
par: Setlur, Amrith, et autres
Publié: (2024)
On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift
par: Thaker, Pratiksha, et autres
Publié: (2023)
par: Thaker, Pratiksha, et autres
Publié: (2023)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
par: Qu, Yuxiao, et autres
Publié: (2026)
par: Qu, Yuxiao, et autres
Publié: (2026)
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024)
par: Ghosal, Gaurav, et autres
Publié: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Lower Bounds for Public-Private Learning under Distribution Shift
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL
par: Wu, Ian, et autres
Publié: (2026)
par: Wu, Ian, et autres
Publié: (2026)
Deep Neural Networks Tend To Extrapolate Predictably
par: Kang, Katie, et autres
Publié: (2023)
par: Kang, Katie, et autres
Publié: (2023)
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
par: Zhong, Ziqian, et autres
Publié: (2026)
par: Zhong, Ziqian, et autres
Publié: (2026)
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
par: Setlur, Amrith, et autres
Publié: (2026)
par: Setlur, Amrith, et autres
Publié: (2026)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic
par: Goyal, Sachin, et autres
Publié: (2024)
par: Goyal, Sachin, et autres
Publié: (2024)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
par: Zhong, Ziqian, et autres
Publié: (2025)
par: Zhong, Ziqian, et autres
Publié: (2025)
Research in Collaborative Learning Does Not Serve Cross-Silo Federated Learning in Practice
par: Kuo, Kevin, et autres
Publié: (2025)
par: Kuo, Kevin, et autres
Publié: (2025)
Mode-Conditioning Unlocks Superior Test-Time Scaling
par: Wu, Chen Henry, et autres
Publié: (2025)
par: Wu, Chen Henry, et autres
Publié: (2025)
Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning
par: Hu, Shengyuan, et autres
Publié: (2024)
par: Hu, Shengyuan, et autres
Publié: (2024)
Sharpness-Aware Minimization Enhances Feature Quality via Balanced Learning
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
par: Springer, Jacob Mitchell, et autres
Publié: (2024)
Overcoming Data and Model Heterogeneities in Decentralized Federated Learning via Synthetic Anchors
par: Huang, Chun-Yin, et autres
Publié: (2024)
par: Huang, Chun-Yin, et autres
Publié: (2024)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
par: Setlur, Amrith, et autres
Publié: (2024)
par: Setlur, Amrith, et autres
Publié: (2024)
Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
par: Kuo, Kevin, et autres
Publié: (2026)
par: Kuo, Kevin, et autres
Publié: (2026)
What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?
par: Kang, Katie, et autres
Publié: (2024)
par: Kang, Katie, et autres
Publié: (2024)
The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data
par: Baek, Christina, et autres
Publié: (2026)
par: Baek, Christina, et autres
Publié: (2026)
Why is SAM Robust to Label Noise?
par: Baek, Christina, et autres
Publié: (2024)
par: Baek, Christina, et autres
Publié: (2024)
IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
par: Cheng, Zhoujun, et autres
Publié: (2026)
par: Cheng, Zhoujun, et autres
Publié: (2026)
Self-Trained Verification for Training- and Test-Time Self-Improvement
par: Wu, Chen Henry, et autres
Publié: (2026)
par: Wu, Chen Henry, et autres
Publié: (2026)
Predicting the Performance of Foundation Models via Agreement-on-the-Line
par: Saxena, Rahul, et autres
Publié: (2024)
par: Saxena, Rahul, et autres
Publié: (2024)
ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
par: Zhong, Ziqian, et autres
Publié: (2025)
par: Zhong, Ziqian, et autres
Publié: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
par: Yang, Matthew Y. R., et autres
Publié: (2026)
par: Yang, Matthew Y. R., et autres
Publié: (2026)
How to Weight Multitask Finetuning? Fast Previews via Bayesian Model-Merging
par: Maldonado, Hugo Monzón, et autres
Publié: (2024)
par: Maldonado, Hugo Monzón, et autres
Publié: (2024)
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
par: Zhang, Biao, et autres
Publié: (2024)
par: Zhang, Biao, et autres
Publié: (2024)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
par: Shen, Junhong, et autres
Publié: (2025)
par: Shen, Junhong, et autres
Publié: (2025)
Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging
par: Khattab, Sameh, et autres
Publié: (2026)
par: Khattab, Sameh, et autres
Publié: (2026)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
par: Kim, Taeyoun, et autres
Publié: (2024)
par: Kim, Taeyoun, et autres
Publié: (2024)
Memorization Sinks: Isolating Memorization during LLM Training
par: Ghosal, Gaurav R., et autres
Publié: (2025)
par: Ghosal, Gaurav R., et autres
Publié: (2025)
Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
par: Gai, Jingchu, et autres
Publié: (2025)
par: Gai, Jingchu, et autres
Publié: (2025)
Documents similaires
-
Multitask Learning Can Improve Worst-Group Outcomes
par: Kulkarni, Atharva, et autres
Publié: (2023) -
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
par: Setlur, Amrith, et autres
Publié: (2024) -
On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift
par: Thaker, Pratiksha, et autres
Publié: (2023) -
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
par: Qu, Yuxiao, et autres
Publié: (2026) -
Understanding Finetuning for Factual Knowledge Extraction
par: Ghosal, Gaurav, et autres
Publié: (2024)