Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rajaraman, Nived, Huang, Audrey, Dudik, Miro, Schapire, Robert, Foster, Dylan J., Krishnamurthy, Akshay |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Hardness of Bandit Learning
par: Brukhim, Nataly, et autres
Publié: (2025)
par: Brukhim, Nataly, et autres
Publié: (2025)
Astral Space: Convex Analysis at Infinity
par: Dudík, Miroslav, et autres
Publié: (2022)
par: Dudík, Miroslav, et autres
Publié: (2022)
Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification
par: Rohatgi, Dhruv, et autres
Publié: (2025)
par: Rohatgi, Dhruv, et autres
Publié: (2025)
Interactive Learning of Single-Index Models via Stochastic Gradient Descent
par: Rajaraman, Nived, et autres
Publié: (2026)
par: Rajaraman, Nived, et autres
Publié: (2026)
Provable Interactive Learning with Hindsight Instruction Feedback
par: Misra, Dipendra, et autres
Publié: (2024)
par: Misra, Dipendra, et autres
Publié: (2024)
Rich-Observation Reinforcement Learning with Continuous Latent Dynamics
par: Song, Yuda, et autres
Publié: (2024)
par: Song, Yuda, et autres
Publié: (2024)
Scalable Online Exploration via Coverability
par: Amortila, Philip, et autres
Publié: (2024)
par: Amortila, Philip, et autres
Publié: (2024)
Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment
par: Huang, Audrey, et autres
Publié: (2025)
par: Huang, Audrey, et autres
Publié: (2025)
Representation-Based Exploration for Language Models: From Test-Time to Post-Training
par: Tuyls, Jens, et autres
Publié: (2025)
par: Tuyls, Jens, et autres
Publié: (2025)
Toward a Theory of Tokenization in LLMs
par: Rajaraman, Nived, et autres
Publié: (2024)
par: Rajaraman, Nived, et autres
Publié: (2024)
Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity
par: Amortila, Philip, et autres
Publié: (2024)
par: Amortila, Philip, et autres
Publié: (2024)
The Space Complexity of Learning-Unlearning Algorithms
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2025)
par: Cherapanamjeri, Yeshwanth, et autres
Publié: (2025)
Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
par: Huang, Audrey, et autres
Publié: (2024)
par: Huang, Audrey, et autres
Publié: (2024)
Self-Improvement in Language Models: The Sharpening Mechanism
par: Huang, Audrey, et autres
Publié: (2024)
par: Huang, Audrey, et autres
Publié: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Can large language models explore in-context?
par: Krishnamurthy, Akshay, et autres
Publié: (2024)
par: Krishnamurthy, Akshay, et autres
Publié: (2024)
A Unifying View of Coverage in Linear Off-Policy Evaluation
par: Amortila, Philip, et autres
Publié: (2026)
par: Amortila, Philip, et autres
Publié: (2026)
Computational Intractability of Strategizing against Online Learners
par: Assos, Angelos, et autres
Publié: (2025)
par: Assos, Angelos, et autres
Publié: (2025)
The Coverage Principle: How Pre-Training Enables Post-Training
par: Chen, Fan, et autres
Publié: (2025)
par: Chen, Fan, et autres
Publié: (2025)
Statistical Complexity and Optimal Algorithms for Non-linear Ridge Bandits
par: Rajaraman, Nived, et autres
Publié: (2023)
par: Rajaraman, Nived, et autres
Publié: (2023)
What One Cannot, Two Can: Two-Layer Transformers Provably Represent Induction Heads on Any-Order Markov Chains
par: Ekbote, Chanakya, et autres
Publié: (2025)
par: Ekbote, Chanakya, et autres
Publié: (2025)
Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference
par: Golowich, Noah, et autres
Publié: (2026)
par: Golowich, Noah, et autres
Publié: (2026)
On Provable Benefits of Muon in Federated Learning
par: Zhang, Xinwen, et autres
Publié: (2025)
par: Zhang, Xinwen, et autres
Publié: (2025)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
par: Xie, Tengyang, et autres
Publié: (2024)
par: Xie, Tengyang, et autres
Publié: (2024)
Provable Benefits of Sinusoidal Activation for Modular Addition
par: Huang, Tianlong, et autres
Publié: (2025)
par: Huang, Tianlong, et autres
Publié: (2025)
Momentum Benefits Non-IID Federated Learning Simply and Provably
par: Cheng, Ziheng, et autres
Publié: (2023)
par: Cheng, Ziheng, et autres
Publié: (2023)
Transformers on Markov Data: Constant Depth Suffices
par: Rajaraman, Nived, et autres
Publié: (2024)
par: Rajaraman, Nived, et autres
Publié: (2024)
On the Benefit of Optimal Transport for Curriculum Reinforcement Learning
par: Klink, Pascal, et autres
Publié: (2023)
par: Klink, Pascal, et autres
Publié: (2023)
The Role of Environment Access in Agnostic Reinforcement Learning
par: Krishnamurthy, Akshay, et autres
Publié: (2025)
par: Krishnamurthy, Akshay, et autres
Publié: (2025)
Provable Benefits of In-Tool Learning for Large Language Models
par: Houliston, Sam, et autres
Publié: (2025)
par: Houliston, Sam, et autres
Publié: (2025)
Provable Benefit of Cutout and CutMix for Feature Learning
par: Oh, Junsoo, et autres
Publié: (2024)
par: Oh, Junsoo, et autres
Publié: (2024)
Mitigating Covariate Shift in Misspecified Regression with Applications to Reinforcement Learning
par: Amortila, Philip, et autres
Publié: (2024)
par: Amortila, Philip, et autres
Publié: (2024)
A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning
par: Gaitonde, Jason, et autres
Publié: (2026)
par: Gaitonde, Jason, et autres
Publié: (2026)
Metastable Dynamics of Chain-of-Thought Reasoning: Provable Benefits of Search, RL and Distillation
par: Kim, Juno, et autres
Publié: (2025)
par: Kim, Juno, et autres
Publié: (2025)
Necessary and Sufficient Oracles: Toward a Computational Taxonomy For Reinforcement Learning
par: Rohatgi, Dhruv, et autres
Publié: (2025)
par: Rohatgi, Dhruv, et autres
Publié: (2025)
Wait, Wait, Wait... Why Do Reasoning Models Loop?
par: Pipis, Charilaos, et autres
Publié: (2025)
par: Pipis, Charilaos, et autres
Publié: (2025)
Provable Benefits of Unsupervised Pre-training and Transfer Learning via Single-Index Models
par: Jones-McCormick, Taj, et autres
Publié: (2025)
par: Jones-McCormick, Taj, et autres
Publié: (2025)
From Markov to Laplace: How Mamba In-Context Learns Markov Chains
par: Bondaschi, Marco, et autres
Publié: (2025)
par: Bondaschi, Marco, et autres
Publié: (2025)
The Power of Resets in Online Reinforcement Learning
par: Mhammedi, Zakaria, et autres
Publié: (2024)
par: Mhammedi, Zakaria, et autres
Publié: (2024)
Documents similaires
-
On the Hardness of Bandit Learning
par: Brukhim, Nataly, et autres
Publié: (2025) -
Astral Space: Convex Analysis at Infinity
par: Dudík, Miroslav, et autres
Publié: (2022) -
Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification
par: Rohatgi, Dhruv, et autres
Publié: (2025) -
Interactive Learning of Single-Index Models via Stochastic Gradient Descent
par: Rajaraman, Nived, et autres
Publié: (2026) -
Provable Interactive Learning with Hindsight Instruction Feedback
par: Misra, Dipendra, et autres
Publié: (2024)