ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gao, Jingyue, Guo, Yanjiang, Chen, Xiaoshuai, Chen, Jianyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
von: Gao, Jingyue, et al.
Veröffentlicht: (2025)
von: Gao, Jingyue, et al.
Veröffentlicht: (2025)
Prediction with Action: Visual Policy Learning via Joint Denoising Process
von: Guo, Yanjiang, et al.
Veröffentlicht: (2024)
von: Guo, Yanjiang, et al.
Veröffentlicht: (2024)
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025)
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025)
DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment
von: Guo, Yanjiang, et al.
Veröffentlicht: (2023)
von: Guo, Yanjiang, et al.
Veröffentlicht: (2023)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)
Efficient and Generalized end-to-end Autonomous Driving System with Latent Deep Reinforcement Learning and Demonstrations
von: Tang, Zuojin, et al.
Veröffentlicht: (2024)
von: Tang, Zuojin, et al.
Veröffentlicht: (2024)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
von: Xie, Tian, et al.
Veröffentlicht: (2025)
von: Xie, Tian, et al.
Veröffentlicht: (2025)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
von: Liu, Shulin, et al.
Veröffentlicht: (2025)
von: Liu, Shulin, et al.
Veröffentlicht: (2025)
UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
Reproducible, Explainable, and Effective Evaluations of Agentic AI for Software Engineering
von: Li, Jingyue, et al.
Veröffentlicht: (2026)
von: Li, Jingyue, et al.
Veröffentlicht: (2026)
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
von: Li, Wanli, et al.
Veröffentlicht: (2026)
von: Li, Wanli, et al.
Veröffentlicht: (2026)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
von: Chen, Wanyi, et al.
Veröffentlicht: (2026)
von: Chen, Wanyi, et al.
Veröffentlicht: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
von: Xu, Ran, et al.
Veröffentlicht: (2025)
von: Xu, Ran, et al.
Veröffentlicht: (2025)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
von: Hou, Hongru, et al.
Veröffentlicht: (2026)
von: Hou, Hongru, et al.
Veröffentlicht: (2026)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
von: Brantley, Kianté, et al.
Veröffentlicht: (2025)
von: Brantley, Kianté, et al.
Veröffentlicht: (2025)
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
von: Yu, Linhao, et al.
Veröffentlicht: (2026)
von: Yu, Linhao, et al.
Veröffentlicht: (2026)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
von: Wu, Xian, et al.
Veröffentlicht: (2026)
von: Wu, Xian, et al.
Veröffentlicht: (2026)
Verifiable Process Rewards for Agentic Reasoning
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
Role-RL: Online Long-Context Processing with Role Reinforcement Learning for Distinct LLMs in Their Optimal Roles
von: He, Lewei, et al.
Veröffentlicht: (2024)
von: He, Lewei, et al.
Veröffentlicht: (2024)
Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning
von: Fanconi, Claudio, et al.
Veröffentlicht: (2025)
von: Fanconi, Claudio, et al.
Veröffentlicht: (2025)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
von: Sun, Zexu, et al.
Veröffentlicht: (2025)
von: Sun, Zexu, et al.
Veröffentlicht: (2025)
Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning
von: Li, Yu, et al.
Veröffentlicht: (2026)
von: Li, Yu, et al.
Veröffentlicht: (2026)
Advancing Humanoid Locomotion: Mastering Challenging Terrains with Denoising World Model Learning
von: Gu, Xinyang, et al.
Veröffentlicht: (2024)
von: Gu, Xinyang, et al.
Veröffentlicht: (2024)
AgentReputation: A Decentralized Agentic AI Reputation Framework
von: Chishti, Mohd Sameen, et al.
Veröffentlicht: (2026)
von: Chishti, Mohd Sameen, et al.
Veröffentlicht: (2026)
TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning
von: Jiang, Zihao, et al.
Veröffentlicht: (2026)
von: Jiang, Zihao, et al.
Veröffentlicht: (2026)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
von: He, Jiashu, et al.
Veröffentlicht: (2025)
von: He, Jiashu, et al.
Veröffentlicht: (2025)
Process In-Context Learning: Enhancing Mathematical Reasoning via Dynamic Demonstration Insertion
von: Gao, Ang, et al.
Veröffentlicht: (2026)
von: Gao, Ang, et al.
Veröffentlicht: (2026)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
CARL: Criticality-Aware Agentic Reinforcement Learning
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
von: Shen, Leyang, et al.
Veröffentlicht: (2025)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
von: Liu, Yihao, et al.
Veröffentlicht: (2025)
von: Liu, Yihao, et al.
Veröffentlicht: (2025)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
von: Wang, Hong, et al.
Veröffentlicht: (2025)
von: Wang, Hong, et al.
Veröffentlicht: (2025)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
von: Ying, Chengyang, et al.
Veröffentlicht: (2025)
von: Ying, Chengyang, et al.
Veröffentlicht: (2025)
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
von: Wei, Yuxiang, et al.
Veröffentlicht: (2025)
von: Wei, Yuxiang, et al.
Veröffentlicht: (2025)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
von: Wen, Xueru, et al.
Veröffentlicht: (2025)
von: Wen, Xueru, et al.
Veröffentlicht: (2025)
ProMind-LLM: Proactive Mental Health Care via Causal Reasoning with Sensor Data
von: Zheng, Xinzhe, et al.
Veröffentlicht: (2025)
von: Zheng, Xinzhe, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
von: Gao, Jingyue, et al.
Veröffentlicht: (2025) -
Prediction with Action: Visual Policy Learning via Joint Denoising Process
von: Guo, Yanjiang, et al.
Veröffentlicht: (2024) -
Ctrl-World: A Controllable Generative World Model for Robot Manipulation
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025) -
DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment
von: Guo, Yanjiang, et al.
Veröffentlicht: (2023) -
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
von: Liu, Mingjie, et al.
Veröffentlicht: (2025)