SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Ruiqi, Arora, Daman, Mei, Song, Zanette, Andrea |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Training Language Models to Reason Efficiently
von: Arora, Daman, et al.
Veröffentlicht: (2025)
von: Arora, Daman, et al.
Veröffentlicht: (2025)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
von: Zeng, Guanning, et al.
Veröffentlicht: (2025)
von: Zeng, Guanning, et al.
Veröffentlicht: (2025)
Is Offline Decision Making Possible with Only Few Samples? Reliable Decisions in Data-Starved Bandits via Trust Region Enhancement
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2024)
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2024)
Maximum Likelihood Reinforcement Learning
von: Tajwar, Fahim, et al.
Veröffentlicht: (2026)
von: Tajwar, Fahim, et al.
Veröffentlicht: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)
Can Large Reasoning Models Self-Train?
von: Shafayat, Sheikh, et al.
Veröffentlicht: (2025)
von: Shafayat, Sheikh, et al.
Veröffentlicht: (2025)
Accelerating Unbiased LLM Evaluation via Synthetic Feedback
von: Zhou, Zhaoyi, et al.
Veröffentlicht: (2025)
von: Zhou, Zhaoyi, et al.
Veröffentlicht: (2025)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
von: Wu, Jiahao, et al.
Veröffentlicht: (2026)
MLMC-based Resource Adequacy Assessment with Active Learning Trained Surrogate Models
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2025)
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
von: Deng, Hexuan, et al.
Veröffentlicht: (2025)
von: Deng, Hexuan, et al.
Veröffentlicht: (2025)
Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum
von: Pouransari, Hadi, et al.
Veröffentlicht: (2024)
von: Pouransari, Hadi, et al.
Veröffentlicht: (2024)
PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation
von: Piché, Alexandre, et al.
Veröffentlicht: (2025)
von: Piché, Alexandre, et al.
Veröffentlicht: (2025)
Expanding the Capabilities of Reinforcement Learning via Text Feedback
von: Song, Yuda, et al.
Veröffentlicht: (2026)
von: Song, Yuda, et al.
Veröffentlicht: (2026)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
von: Zhang, Yiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Yiqi, et al.
Veröffentlicht: (2026)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
von: Zhou, Yifei, et al.
Veröffentlicht: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2024)
Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training
von: Bu, Dake, et al.
Veröffentlicht: (2025)
von: Bu, Dake, et al.
Veröffentlicht: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing
von: Khan, Azal Ahmad, et al.
Veröffentlicht: (2026)
von: Khan, Azal Ahmad, et al.
Veröffentlicht: (2026)
Learning Dynamics in RL Post-Training for Language Models
von: Tomihari, Akiyoshi
Veröffentlicht: (2026)
von: Tomihari, Akiyoshi
Veröffentlicht: (2026)
On the Optimal Reasoning Length for RL-Trained Language Models
von: Nohara, Daisuke, et al.
Veröffentlicht: (2026)
von: Nohara, Daisuke, et al.
Veröffentlicht: (2026)
Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training
von: Cui, Peng, et al.
Veröffentlicht: (2026)
von: Cui, Peng, et al.
Veröffentlicht: (2026)
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
von: Qu, Yun, et al.
Veröffentlicht: (2025)
von: Qu, Yun, et al.
Veröffentlicht: (2025)
RL-PINNs: Reinforcement Learning-Driven Adaptive Sampling for Efficient Training of PINNs
von: Song, Zhenao
Veröffentlicht: (2025)
von: Song, Zhenao
Veröffentlicht: (2025)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
von: Hammoud, Hasan Abed Al Kader, et al.
Veröffentlicht: (2025)
von: Hammoud, Hasan Abed Al Kader, et al.
Veröffentlicht: (2025)
Train Less, Infer Faster: Efficient Model Finetuning and Compression via Structured Sparsity
von: Svirsky, Jonathan, et al.
Veröffentlicht: (2026)
von: Svirsky, Jonathan, et al.
Veröffentlicht: (2026)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
von: Xu, Charles, et al.
Veröffentlicht: (2026)
von: Xu, Charles, et al.
Veröffentlicht: (2026)
LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
von: Wong, Zhen Hao, et al.
Veröffentlicht: (2025)
von: Wong, Zhen Hao, et al.
Veröffentlicht: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
von: Chen, Kang, et al.
Veröffentlicht: (2025)
von: Chen, Kang, et al.
Veröffentlicht: (2025)
Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
von: Pardinas, Rafael, et al.
Veröffentlicht: (2026)
von: Pardinas, Rafael, et al.
Veröffentlicht: (2026)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
von: Oertell, Owen, et al.
Veröffentlicht: (2024)
von: Oertell, Owen, et al.
Veröffentlicht: (2024)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
Behavior-Adaptive Q-Learning: A Unifying Framework for Offline-to-Online RL
von: Zu, Lipeng, et al.
Veröffentlicht: (2025)
von: Zu, Lipeng, et al.
Veröffentlicht: (2025)
GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
von: Bai, Yuyang, et al.
Veröffentlicht: (2026)
von: Bai, Yuyang, et al.
Veröffentlicht: (2026)
SPEED: Experimental Design for Policy Evaluation in Linear Heteroscedastic Bandits
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2023)
von: Mukherjee, Subhojyoti, et al.
Veröffentlicht: (2023)
Accelerating Transformers in Online RL
von: Zelezetsky, Daniil, et al.
Veröffentlicht: (2025)
von: Zelezetsky, Daniil, et al.
Veröffentlicht: (2025)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
von: Wang, Qi, et al.
Veröffentlicht: (2023)
von: Wang, Qi, et al.
Veröffentlicht: (2023)
RL's Razor: Why Online Reinforcement Learning Forgets Less
von: Shenfeld, Idan, et al.
Veröffentlicht: (2025)
von: Shenfeld, Idan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Training Language Models to Reason Efficiently
von: Arora, Daman, et al.
Veröffentlicht: (2025) -
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
von: Zeng, Guanning, et al.
Veröffentlicht: (2025) -
Is Offline Decision Making Possible with Only Few Samples? Reliable Decisions in Data-Starved Bandits via Trust Region Enhancement
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2024) -
Maximum Likelihood Reinforcement Learning
von: Tajwar, Fahim, et al.
Veröffentlicht: (2026) -
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
von: Zhou, Yifei, et al.
Veröffentlicht: (2024)