Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Fei, Wu, Kong, Hao, Liang, Shuxian, Lin, Yang, Yang, Yibo, Tang, Jing, Chen, Lei, Hua, Xiansheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
by: Xu, Yuyang, et al.
Published: (2025)
by: Xu, Yuyang, et al.
Published: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
by: Xu, Huimin, et al.
Published: (2025)
by: Xu, Huimin, et al.
Published: (2025)
DRM: Diffusion-based Reward Model With Step-wise Guidance
by: Zhang, Jaxon, et al.
Published: (2026)
by: Zhang, Jaxon, et al.
Published: (2026)
SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
by: Shi, Qiming, et al.
Published: (2026)
by: Shi, Qiming, et al.
Published: (2026)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)
by: Rezaei, Mohammad, et al.
Published: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025)
by: Liu, Xiaoqian, et al.
Published: (2025)
Step-wise Rubric Rewards for LLM Reasoning
by: Xie, Weichu, et al.
Published: (2026)
by: Xie, Weichu, et al.
Published: (2026)
Generalized Global Self-Optimizing Control for Chemical Processes: Part II Objective-Guided Controlled Variable Learning Approach
by: Zhou, Chenchen, et al.
Published: (2026)
by: Zhou, Chenchen, et al.
Published: (2026)
Robust Offline Reinforcement Learning for Non-Markovian Decision Processes
by: Huang, Ruiquan, et al.
Published: (2024)
by: Huang, Ruiquan, et al.
Published: (2024)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
by: Liu, Tenglong, et al.
Published: (2024)
by: Liu, Tenglong, et al.
Published: (2024)
Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages
by: Kunde, Vishnu Teja, et al.
Published: (2026)
by: Kunde, Vishnu Teja, et al.
Published: (2026)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
PRO-CUA: Process-Reward Optimization for Computer Use Agents
by: He, Yifei, et al.
Published: (2026)
by: He, Yifei, et al.
Published: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
by: Yang, Wenkai, et al.
Published: (2025)
by: Yang, Wenkai, et al.
Published: (2025)
SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
by: Rahman, Salman, et al.
Published: (2025)
by: Rahman, Salman, et al.
Published: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
by: Ye, Shenghao, et al.
Published: (2026)
by: Ye, Shenghao, et al.
Published: (2026)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
by: Tao, Sicheng, et al.
Published: (2025)
by: Tao, Sicheng, et al.
Published: (2025)
Process Rewards with Learned Reliability
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation
by: Li, Rui, et al.
Published: (2026)
by: Li, Rui, et al.
Published: (2026)
Learning Granger Causality from Instance-wise Self-attentive Hawkes Processes
by: Wu, Dongxia, et al.
Published: (2024)
by: Wu, Dongxia, et al.
Published: (2024)
Practical Process Capability Indices Workflows
by: Jiang, Fei, et al.
Published: (2026)
by: Jiang, Fei, et al.
Published: (2026)
FreePRM: Training Process Reward Models Without Ground Truth Process Labels
by: Sun, Lin, et al.
Published: (2025)
by: Sun, Lin, et al.
Published: (2025)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
by: Zhang, Dan, et al.
Published: (2024)
by: Zhang, Dan, et al.
Published: (2024)
GeoLink: A 3D-Aware Framework Towards Better Generalization in Cross-View Geo-Localization
by: Zhang, Hongyang, et al.
Published: (2026)
by: Zhang, Hongyang, et al.
Published: (2026)
Keyframe-Guided Structured Rewards for Reinforcement Learning in Long-Horizon Laboratory Robotics
by: Qiu, Yibo, et al.
Published: (2026)
by: Qiu, Yibo, et al.
Published: (2026)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
by: Lai, Xin, et al.
Published: (2024)
by: Lai, Xin, et al.
Published: (2024)
Average Reward Reinforcement Learning for Wireless Radio Resource Management
by: Yang, Kun, et al.
Published: (2025)
by: Yang, Kun, et al.
Published: (2025)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
by: Du, Huifang, et al.
Published: (2024)
by: Du, Huifang, et al.
Published: (2024)
Uncertainty-Aware Step-wise Verification with Generative Reward Models
by: Ye, Zihuiwen, et al.
Published: (2025)
by: Ye, Zihuiwen, et al.
Published: (2025)
Risk-Calibrated Process Capability Approval with Finite Samples
by: Jiang, Fei, et al.
Published: (2026)
by: Jiang, Fei, et al.
Published: (2026)
Uncertainty-aware Reward Design Process
by: Yang, Yang, et al.
Published: (2025)
by: Yang, Yang, et al.
Published: (2025)
SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
by: Ding, Yuyang, et al.
Published: (2025)
by: Ding, Yuyang, et al.
Published: (2025)
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
by: Luo, Yihong, et al.
Published: (2026)
by: Luo, Yihong, et al.
Published: (2026)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
by: Deng, Zhirui, et al.
Published: (2024)
by: Deng, Zhirui, et al.
Published: (2024)
Redefining Fitness: Evolution as a Dynamic Learning Process
by: Bettencourt, Luís MA, et al.
Published: (2025)
by: Bettencourt, Luís MA, et al.
Published: (2025)
Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
by: Zhang, Wenlin, et al.
Published: (2025)
by: Zhang, Wenlin, et al.
Published: (2025)
StepScorer: Accelerating Reinforcement Learning with Step-wise Scoring and Psychological Regret Modeling
by: Xu, Zhe
Published: (2026)
by: Xu, Zhe
Published: (2026)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
by: Li, Zhaoyan, et al.
Published: (2026)
by: Li, Zhaoyan, et al.
Published: (2026)
Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning
by: Zhou, Qin, et al.
Published: (2026)
by: Zhou, Qin, et al.
Published: (2026)
Similar Items
-
SSPO: Self-traced Step-wise Preference Optimization for Process Supervision and Reasoning Compression
by: Xu, Yuyang, et al.
Published: (2025) -
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
by: Xu, Huimin, et al.
Published: (2025) -
DRM: Diffusion-based Reward Model With Step-wise Guidance
by: Zhang, Jaxon, et al.
Published: (2026) -
SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
by: Shi, Qiming, et al.
Published: (2026) -
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)