Scheduling Your LLM Reinforcement Learning with Reasoning Trees
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Hong, Hao, Zhezheng, Luo, Jian, Wei, Chenxing, Shu, Yao, Liu, Lei, Lin, Qiang, Dong, Hande, Chen, Jiawei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
by: Hao, Zhezheng, et al.
Published: (2026)
by: Hao, Zhezheng, et al.
Published: (2026)
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
by: Hao, Zhezheng, et al.
Published: (2025)
by: Hao, Zhezheng, et al.
Published: (2025)
Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems
by: Hao, Zhezheng, et al.
Published: (2026)
by: Hao, Zhezheng, et al.
Published: (2026)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
by: Zhou, Yuyan, et al.
Published: (2026)
by: Zhou, Yuyan, et al.
Published: (2026)
GAPO: Robust Advantage Estimation for Real-World Code LLMs
by: Zhang, Jianqing, et al.
Published: (2025)
by: Zhang, Jianqing, et al.
Published: (2025)
ReDit: Reward Dithering for Improved LLM Policy Optimization
by: Wei, Chenxing, et al.
Published: (2025)
by: Wei, Chenxing, et al.
Published: (2025)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
by: Li, Jinke, et al.
Published: (2025)
by: Li, Jinke, et al.
Published: (2025)
Accelerating IC Thermal Simulation Data Generation via Block Krylov and Operator Action
by: Wang, Hong, et al.
Published: (2025)
by: Wang, Hong, et al.
Published: (2025)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
by: Hao, Qianyue, et al.
Published: (2025)
by: Hao, Qianyue, et al.
Published: (2025)
DSO: Dual-Scale Neural Operators for Stable Long-term Fluid Dynamics Forecasting
by: Dong, Huanshuo, et al.
Published: (2026)
by: Dong, Huanshuo, et al.
Published: (2026)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
by: Wang, Pinzheng, et al.
Published: (2026)
by: Wang, Pinzheng, et al.
Published: (2026)
Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent
by: Shu, Yao, et al.
Published: (2026)
by: Shu, Yao, et al.
Published: (2026)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning
by: Zhou, Jiahui, et al.
Published: (2026)
by: Zhou, Jiahui, et al.
Published: (2026)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
by: Xie, Tian, et al.
Published: (2025)
by: Xie, Tian, et al.
Published: (2025)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
by: Shan, Lianlei, et al.
Published: (2026)
by: Shan, Lianlei, et al.
Published: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
by: Ning, Yansong, et al.
Published: (2025)
by: Ning, Yansong, et al.
Published: (2025)
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
by: Jin, Bowen, et al.
Published: (2025)
by: Jin, Bowen, et al.
Published: (2025)
Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer
by: Wang, Tianfu, et al.
Published: (2026)
by: Wang, Tianfu, et al.
Published: (2026)
Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
by: Li, Jipeng, et al.
Published: (2025)
by: Li, Jipeng, et al.
Published: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
by: Wu, Junfei, et al.
Published: (2025)
by: Wu, Junfei, et al.
Published: (2025)
Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports
by: Wei, Yishu, et al.
Published: (2026)
by: Wei, Yishu, et al.
Published: (2026)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
by: Xiong, Wei, et al.
Published: (2025)
by: Xiong, Wei, et al.
Published: (2025)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
by: Zheng, Haizhong, et al.
Published: (2025)
by: Zheng, Haizhong, et al.
Published: (2025)
ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents
by: Ding, Lei, et al.
Published: (2026)
by: Ding, Lei, et al.
Published: (2026)
Flexora: Flexible Low Rank Adaptation for Large Language Models
by: Wei, Chenxing, et al.
Published: (2024)
by: Wei, Chenxing, et al.
Published: (2024)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
by: Shen, Maohao, et al.
Published: (2025)
by: Shen, Maohao, et al.
Published: (2025)
AP2O-Coder: Adaptively Progressive Preference Optimization for Reducing Compilation and Runtime Errors in LLM-Generated Code
by: Zhang, Jianqing, et al.
Published: (2025)
by: Zhang, Jianqing, et al.
Published: (2025)
SAGE: Multi-Agent Self-Evolution for LLM Reasoning
by: Peng, Yulin, et al.
Published: (2026)
by: Peng, Yulin, et al.
Published: (2026)
Trading-R1: Financial Trading with LLM Reasoning via Reinforcement Learning
by: Xiao, Yijia, et al.
Published: (2025)
by: Xiao, Yijia, et al.
Published: (2025)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
by: Sun, Yiliu, et al.
Published: (2025)
by: Sun, Yiliu, et al.
Published: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Learning From Mistakes Makes LLM Better Reasoner
by: An, Shengnan, et al.
Published: (2023)
by: An, Shengnan, et al.
Published: (2023)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
by: Tan, Zelin, et al.
Published: (2025)
by: Tan, Zelin, et al.
Published: (2025)
Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
by: Fang, Hao, et al.
Published: (2025)
by: Fang, Hao, et al.
Published: (2025)
Make Your LLM Fully Utilize the Context
by: An, Shengnan, et al.
Published: (2024)
by: An, Shengnan, et al.
Published: (2024)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
by: Liu, Huanyu, et al.
Published: (2025)
by: Liu, Huanyu, et al.
Published: (2025)
Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning
by: Chen, Liuji, et al.
Published: (2026)
by: Chen, Liuji, et al.
Published: (2026)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
by: Jiang, Zhizheng, et al.
Published: (2026)
by: Jiang, Zhizheng, et al.
Published: (2026)
Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization
by: Kong, Jiawei, et al.
Published: (2026)
by: Kong, Jiawei, et al.
Published: (2026)
Similar Items
-
ReCreate: Reasoning and Creating Domain Agents Driven by Experience
by: Hao, Zhezheng, et al.
Published: (2026) -
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
by: Hao, Zhezheng, et al.
Published: (2025) -
Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems
by: Hao, Zhezheng, et al.
Published: (2026) -
LEPO: Latent Reasoning Policy Optimization for Large Language Models
by: Zhou, Yuyan, et al.
Published: (2026) -
GAPO: Robust Advantage Estimation for Real-World Code LLMs
by: Zhang, Jianqing, et al.
Published: (2025)