Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Parashar, Shubham, Gui, Shurui, Li, Xiner, Ling, Hongyi, Vemuri, Sushil, Olson, Blake, Li, Eric, Zhang, Yu, Caverlee, James, Kalathil, Dileep, Ji, Shuiwang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Inference-Time Computations for LLM Reasoning and Planning: A Benchmark and Insights
by: Parashar, Shubham, et al.
Published: (2025)
by: Parashar, Shubham, et al.
Published: (2025)
Active Test-Time Adaptation: Theoretical Analyses and An Algorithm
by: Gui, Shurui, et al.
Published: (2024)
by: Gui, Shurui, et al.
Published: (2024)
Discovering Physics Laws of Dynamical Systems via Invariant Function Learning
by: Gui, Shurui, et al.
Published: (2025)
by: Gui, Shurui, et al.
Published: (2025)
A Hierarchical Language Model For Interpretable Graph Reasoning
by: Khurana, Sambhav, et al.
Published: (2024)
by: Khurana, Sambhav, et al.
Published: (2024)
Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning
by: Saj, Vishnu, et al.
Published: (2026)
by: Saj, Vishnu, et al.
Published: (2026)
Graph Structure and Feature Extrapolation for Out-of-Distribution Generalization
by: Li, Xiner, et al.
Published: (2023)
by: Li, Xiner, et al.
Published: (2023)
Complex LLM Planning via Automated Heuristics Discovery
by: Ling, Hongyi, et al.
Published: (2025)
by: Ling, Hongyi, et al.
Published: (2025)
Fragment and Geometry Aware Tokenization of Molecules for Structure-Based Drug Design Using Language Models
by: Fu, Cong, et al.
Published: (2024)
by: Fu, Cong, et al.
Published: (2024)
Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training
by: Gui, Shurui, et al.
Published: (2025)
by: Gui, Shurui, et al.
Published: (2025)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
by: Xu, Zaiyan, et al.
Published: (2025)
by: Xu, Zaiyan, et al.
Published: (2025)
Geometry Informed Tokenization of Molecules for Language Model Generation
by: Li, Xiner, et al.
Published: (2024)
by: Li, Xiner, et al.
Published: (2024)
Equivariance via Minimal Frame Averaging for More Symmetries and Efficiency
by: Lin, Yuchao, et al.
Published: (2024)
by: Lin, Yuchao, et al.
Published: (2024)
Federated Ensemble-Directed Offline Reinforcement Learning
by: Rengarajan, Desik, et al.
Published: (2023)
by: Rengarajan, Desik, et al.
Published: (2023)
FlowX: Towards Explainable Graph Neural Networks via Message Flows
by: Gui, Shurui, et al.
Published: (2022)
by: Gui, Shurui, et al.
Published: (2022)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
by: Gohil, Vasudev, et al.
Published: (2024)
by: Gohil, Vasudev, et al.
Published: (2024)
Object-Aware 4D Human Motion Generation
by: Gui, Shurui, et al.
Published: (2025)
by: Gui, Shurui, et al.
Published: (2025)
Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning
by: Mordig, Maximilian, et al.
Published: (2026)
by: Mordig, Maximilian, et al.
Published: (2026)
Invariant Tokenization of Crystalline Materials for Language Model Enabled Generation
by: Yan, Keqiang, et al.
Published: (2025)
by: Yan, Keqiang, et al.
Published: (2025)
Language Models for Controllable DNA Sequence Design
by: Su, Xingyu, et al.
Published: (2025)
by: Su, Xingyu, et al.
Published: (2025)
PowerMamba: A Deep State Space Model and Comprehensive Benchmark for Time Series Prediction in Electric Power Systems
by: Menati, Ali, et al.
Published: (2024)
by: Menati, Ali, et al.
Published: (2024)
MAVIS: Multi-Objective Alignment via Inference-Time Value-Guided Selection
by: Carleton, Jeremy, et al.
Published: (2025)
by: Carleton, Jeremy, et al.
Published: (2025)
Risk-Averse Finetuning of Large Language Models
by: Chaudhary, Sapana, et al.
Published: (2025)
by: Chaudhary, Sapana, et al.
Published: (2025)
Selling Demand Response Using Options
by: Muthirayan, Deepan, et al.
Published: (2019)
by: Muthirayan, Deepan, et al.
Published: (2019)
Structured Reinforcement Learning for Media Streaming at the Wireless Edge
by: Bura, Archana, et al.
Published: (2024)
by: Bura, Archana, et al.
Published: (2024)
The Neglected Tails in Vision-Language Models
by: Parashar, Shubham, et al.
Published: (2024)
by: Parashar, Shubham, et al.
Published: (2024)
From Easy to Hard++: Promoting Differentially Private Image Synthesis Through Spatial-Frequency Curriculum
by: Gong, Chen, et al.
Published: (2026)
by: Gong, Chen, et al.
Published: (2026)
Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning
by: Mete, Akshay, et al.
Published: (2026)
by: Mete, Akshay, et al.
Published: (2026)
Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
by: Ling, Zehui, et al.
Published: (2025)
by: Ling, Zehui, et al.
Published: (2025)
The Unreasonable Effectiveness of Easy Training Data for Hard Tasks
by: Hase, Peter, et al.
Published: (2024)
by: Hase, Peter, et al.
Published: (2024)
Language Models Do Hard Arithmetic Tasks Easily and Hardly Do Easy Arithmetic Tasks
by: Gambardella, Andrew, et al.
Published: (2024)
by: Gambardella, Andrew, et al.
Published: (2024)
Can an Easy-to-Hard Curriculum Make Reasoning Emerge in Small Language Models? Evidence from a Four-Stage Curriculum on GPT-2
by: Fu, Xiang
Published: (2025)
by: Fu, Xiang
Published: (2025)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
by: Kunde, Vishnu Teja, et al.
Published: (2026)
by: Kunde, Vishnu Teja, et al.
Published: (2026)
Abstractions-of-Thought: Intermediate Representations for LLM Reasoning in Hardware Design
by: DeLorenzo, Matthew, et al.
Published: (2025)
by: DeLorenzo, Matthew, et al.
Published: (2025)
Charge Puddles Driven Complex Crossover of Magnetoresistance in Non‐Topological Sulfur Doped Antimony Selenide Nanowires
by: Sushil Kumar, et al.
Published: (2024)
by: Sushil Kumar, et al.
Published: (2024)
Reward-Guided Iterative Refinement in Diffusion Models at Test-Time with Applications to Protein and DNA Design
by: Uehara, Masatoshi, et al.
Published: (2025)
by: Uehara, Masatoshi, et al.
Published: (2025)
Dynamic Search for Inference-Time Alignment in Diffusion Models
by: Li, Xiner, et al.
Published: (2025)
by: Li, Xiner, et al.
Published: (2025)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
by: Cheng, Min, et al.
Published: (2025)
by: Cheng, Min, et al.
Published: (2025)
Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning
by: Rui, Shaohao, et al.
Published: (2025)
by: Rui, Shaohao, et al.
Published: (2025)
Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges
by: Lee, Nayoung, et al.
Published: (2025)
by: Lee, Nayoung, et al.
Published: (2025)
A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula
by: Liu, Chenruo, et al.
Published: (2026)
by: Liu, Chenruo, et al.
Published: (2026)
Similar Items
-
Inference-Time Computations for LLM Reasoning and Planning: A Benchmark and Insights
by: Parashar, Shubham, et al.
Published: (2025) -
Active Test-Time Adaptation: Theoretical Analyses and An Algorithm
by: Gui, Shurui, et al.
Published: (2024) -
Discovering Physics Laws of Dynamical Systems via Invariant Function Learning
by: Gui, Shurui, et al.
Published: (2025) -
A Hierarchical Language Model For Interpretable Graph Reasoning
by: Khurana, Sambhav, et al.
Published: (2024) -
Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning
by: Saj, Vishnu, et al.
Published: (2026)