A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Congmin, Zhu, Jiachen, Ou, Zhuoying, Chen, Yuxiang, Zhang, Kangning, Shan, Rong, Zheng, Zeyu, Yang, Mengyue, Lin, Jianghao, Yu, Yong, Zhang, Weinan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
by: Zheng, Congmin, et al.
Published: (2025)
by: Zheng, Congmin, et al.
Published: (2025)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
by: Zhu, Jiachen, et al.
Published: (2025)
by: Zhu, Jiachen, et al.
Published: (2025)
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
by: Zhu, Jiachen, et al.
Published: (2026)
by: Zhu, Jiachen, et al.
Published: (2026)
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
by: Zhu, Jiachen, et al.
Published: (2026)
by: Zhu, Jiachen, et al.
Published: (2026)
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
by: Zhu, Jiachen, et al.
Published: (2025)
by: Zhu, Jiachen, et al.
Published: (2025)
Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents
by: Shan, Rong, et al.
Published: (2026)
by: Shan, Rong, et al.
Published: (2026)
Full-Stack Optimized Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
by: Shan, Rong, et al.
Published: (2025)
by: Shan, Rong, et al.
Published: (2025)
An Automatic Graph Construction Framework based on Large Language Models for Recommendation
by: Shan, Rong, et al.
Published: (2024)
by: Shan, Rong, et al.
Published: (2024)
Lifelong Personalized Low-Rank Adaptation of Large Language Models for Recommendation
by: Zhu, Jiachen, et al.
Published: (2024)
by: Zhu, Jiachen, et al.
Published: (2024)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
A Survey on Diffusion Models for Recommender Systems
by: Lin, Jianghao, et al.
Published: (2024)
by: Lin, Jianghao, et al.
Published: (2024)
Large Language Models Make Sample-Efficient Recommender Systems
by: Lin, Jianghao, et al.
Published: (2024)
by: Lin, Jianghao, et al.
Published: (2024)
Better Process Supervision with Bi-directional Rewarding Signals
by: Chen, Wenxiang, et al.
Published: (2025)
by: Chen, Wenxiang, et al.
Published: (2025)
Adaptive Milestone Reward for GUI Agents
by: Zheng, Congmin, et al.
Published: (2026)
by: Zheng, Congmin, et al.
Published: (2026)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
by: Xi, Yunjia, et al.
Published: (2025)
by: Xi, Yunjia, et al.
Published: (2025)
ReLLa: Retrieval-enhanced Large Language Models for Lifelong Sequential Behavior Comprehension in Recommendation
by: Lin, Jianghao, et al.
Published: (2023)
by: Lin, Jianghao, et al.
Published: (2023)
Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
by: Wang, Binghai, et al.
Published: (2026)
by: Wang, Binghai, et al.
Published: (2026)
Learning ID-free Item Representation with Token Crossing for Multimodal Recommendation
by: Zhang, Kangning, et al.
Published: (2024)
by: Zhang, Kangning, et al.
Published: (2024)
Entropy-Regularized Process Reward Model
by: Zhang, Hanning, et al.
Published: (2024)
by: Zhang, Hanning, et al.
Published: (2024)
ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction
by: Lin, Jianghao, et al.
Published: (2023)
by: Lin, Jianghao, et al.
Published: (2023)
Superplatforms Have to Attack AI Agents
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
M-scan: A Multi-Scenario Causal-driven Adaptive Network for Recommendation
by: Zhu, Jiachen, et al.
Published: (2024)
by: Zhu, Jiachen, et al.
Published: (2024)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
by: Qiu, Zhisong, et al.
Published: (2026)
by: Qiu, Zhisong, et al.
Published: (2026)
Towards Efficient and Effective Unlearning of Large Language Models for Recommendation
by: Wang, Hangyu, et al.
Published: (2024)
by: Wang, Hangyu, et al.
Published: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
by: Zhang, Zhenru, et al.
Published: (2025)
by: Zhang, Zhenru, et al.
Published: (2025)
How Can Recommender Systems Benefit from Large Language Models: A Survey
by: Lin, Jianghao, et al.
Published: (2023)
by: Lin, Jianghao, et al.
Published: (2023)
The Bidirectional Process Reward Model
by: Zhang, Lingyin, et al.
Published: (2025)
by: Zhang, Lingyin, et al.
Published: (2025)
MemoCRS: Memory-enhanced Sequential Conversational Recommender Systems with Large Language Models
by: Xi, Yunjia, et al.
Published: (2024)
by: Xi, Yunjia, et al.
Published: (2024)
Hierarchical Process Reward Models are Symbolic Vision Learners
by: Zhang, Shan, et al.
Published: (2025)
by: Zhang, Shan, et al.
Published: (2025)
MassTool: A Multi-Task Search-Based Tool Retrieval Framework for Large Language Models
by: Lin, Jianghao, et al.
Published: (2025)
by: Lin, Jianghao, et al.
Published: (2025)
Play to Your Strengths: Collaborative Intelligence of Conventional Recommender Models and Large Language Models
by: Xi, Yunjia, et al.
Published: (2024)
by: Xi, Yunjia, et al.
Published: (2024)
StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models
by: Zhou, Chenyu, et al.
Published: (2025)
by: Zhou, Chenyu, et al.
Published: (2025)
Generative Representational Learning of Foundation Models for Recommendation
by: Zhou, Zheli, et al.
Published: (2025)
by: Zhou, Zheli, et al.
Published: (2025)
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
by: Zhang, Yao, et al.
Published: (2026)
by: Zhang, Yao, et al.
Published: (2026)
Survey on Visual Signal Coding and Processing with Generative Models: Technologies, Standards and Optimization
by: Chen, Zhibo, et al.
Published: (2024)
by: Chen, Zhibo, et al.
Published: (2024)
SINKT: A Structure-Aware Inductive Knowledge Tracing Model with Large Language Model
by: Fu, Lingyue, et al.
Published: (2024)
by: Fu, Lingyue, et al.
Published: (2024)
A Comprehensive Survey on Retrieval Methods in Recommender Systems
by: Huang, Junjie, et al.
Published: (2024)
by: Huang, Junjie, et al.
Published: (2024)
DREAM: A Dual Representation Learning Model for Multimodal Recommendation
by: Zhang, Kangning, et al.
Published: (2024)
by: Zhang, Kangning, et al.
Published: (2024)
Smaller Models, Smarter Rewards: A Two-Sided Approach to Process and Outcome Rewards
by: Groeneveld, Jan Niklas, et al.
Published: (2025)
by: Groeneveld, Jan Niklas, et al.
Published: (2025)
Similar Items
-
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
by: Zheng, Congmin, et al.
Published: (2025) -
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
by: Zhu, Jiachen, et al.
Published: (2025) -
Contexting as Recommendation: Evolutionary Collaborative Filtering for Context Engineering
by: Zhu, Jiachen, et al.
Published: (2026) -
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
by: Zhu, Jiachen, et al.
Published: (2026) -
Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
by: Lin, Jianghao, et al.
Published: (2025)