Process Reward Agents for Steering Knowledge-Intensive Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Sohn, Jiwoong, Sternal, Tomasz, Styppa, Kenneth, Hoefler, Torsten, Moor, Michael |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling
by: Xiao, Qiao, et al.
Published: (2026)
by: Xiao, Qiao, et al.
Published: (2026)
When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
by: Wu, Boqian, et al.
Published: (2026)
by: Wu, Boqian, et al.
Published: (2026)
Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language Models
by: Jeong, Minbyul, et al.
Published: (2024)
by: Jeong, Minbyul, et al.
Published: (2024)
Reasoning Language Models: A Blueprint
by: Besta, Maciej, et al.
Published: (2025)
by: Besta, Maciej, et al.
Published: (2025)
Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
by: Plecko, Drago, et al.
Published: (2025)
by: Plecko, Drago, et al.
Published: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
KGARevion: An AI Agent for Knowledge-Intensive Biomedical QA
by: Su, Xiaorui, et al.
Published: (2024)
by: Su, Xiaorui, et al.
Published: (2024)
Verifiable Process Rewards for Agentic Reasoning
by: Yuan, Huining, et al.
Published: (2026)
by: Yuan, Huining, et al.
Published: (2026)
AgentRxiv: Towards Collaborative Autonomous Research
by: Schmidgall, Samuel, et al.
Published: (2025)
by: Schmidgall, Samuel, et al.
Published: (2025)
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
by: Zhang, Yao, et al.
Published: (2026)
by: Zhang, Yao, et al.
Published: (2026)
AGACCI : Affiliated Grading Agents for Criteria-Centric Interface in Educational Coding Contexts
by: Park, Kwangsuk, et al.
Published: (2025)
by: Park, Kwangsuk, et al.
Published: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
by: Limozin, Alexis, et al.
Published: (2026)
by: Limozin, Alexis, et al.
Published: (2026)
Compute Allocation for Reasoning-Intensive Retrieval Agents
by: Apparaju, Sreeja, et al.
Published: (2026)
by: Apparaju, Sreeja, et al.
Published: (2026)
Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing
by: Mao, Qinghua, et al.
Published: (2026)
by: Mao, Qinghua, et al.
Published: (2026)
FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning
by: Deng, Shuangyan, et al.
Published: (2025)
by: Deng, Shuangyan, et al.
Published: (2025)
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
by: Li, Jiakang, et al.
Published: (2026)
by: Li, Jiakang, et al.
Published: (2026)
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
by: Hu, Yulan, et al.
Published: (2025)
by: Hu, Yulan, et al.
Published: (2025)
Rewarding Structural Conformance of Reasoning using Process Mining
by: Lee, Yongjae, et al.
Published: (2025)
by: Lee, Yongjae, et al.
Published: (2025)
REAL: Resolving Knowledge Conflicts in Knowledge-Intensive Visual Question Answering via Reasoning-Pivot Alignment
by: Ye, Kai, et al.
Published: (2026)
by: Ye, Kai, et al.
Published: (2026)
Exploring Reasoning Reward Model for Agents
by: Fan, Kaixuan, et al.
Published: (2026)
by: Fan, Kaixuan, et al.
Published: (2026)
GUI-PRA: Process Reward Agent for GUI Tasks
by: Xiong, Tao, et al.
Published: (2025)
by: Xiong, Tao, et al.
Published: (2025)
RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoning
by: Liu, Xiao, et al.
Published: (2025)
by: Liu, Xiao, et al.
Published: (2025)
Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards
by: Xie, Shaoan, et al.
Published: (2025)
by: Xie, Shaoan, et al.
Published: (2025)
Confounder Detection via Treatment Intent: A New Observational Study Design
by: Plecko, Drago, et al.
Published: (2026)
by: Plecko, Drago, et al.
Published: (2026)
PRO-CUA: Process-Reward Optimization for Computer Use Agents
by: He, Yifei, et al.
Published: (2026)
by: He, Yifei, et al.
Published: (2026)
Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning
by: Yang, Zhaohui, et al.
Published: (2025)
by: Yang, Zhaohui, et al.
Published: (2025)
MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning
by: Su, Crystal
Published: (2025)
by: Su, Crystal
Published: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)
by: Rezaei, Mohammad, et al.
Published: (2026)
Making Sense of Knowledge Intensive Processes: an Oil & Gas Industry Scenario
by: Ferreira, Juliana Jansen, et al.
Published: (2024)
by: Ferreira, Juliana Jansen, et al.
Published: (2024)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
by: Yang, Pei, et al.
Published: (2025)
by: Yang, Pei, et al.
Published: (2025)
Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques
by: Li, Chen, et al.
Published: (2024)
by: Li, Chen, et al.
Published: (2024)
SmartSearch: Process Reward-Guided Query Refinement for Search Agents
by: Wen, Tongyu, et al.
Published: (2026)
by: Wen, Tongyu, et al.
Published: (2026)
Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents
by: Shu, Jiangming, et al.
Published: (2026)
by: Shu, Jiangming, et al.
Published: (2026)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
by: Choi, Changin, et al.
Published: (2025)
by: Choi, Changin, et al.
Published: (2025)
MASPRM: Multi-Agent System Process Reward Model
by: Yazdani, Milad, et al.
Published: (2025)
by: Yazdani, Milad, et al.
Published: (2025)
MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier
by: Su, Crystal
Published: (2025)
by: Su, Crystal
Published: (2025)
Multimodal Reranking for Knowledge-Intensive Visual Question Answering
by: Wen, Haoyang, et al.
Published: (2024)
by: Wen, Haoyang, et al.
Published: (2024)
Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning
by: Lee, Chaeeun, et al.
Published: (2026)
by: Lee, Chaeeun, et al.
Published: (2026)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
by: Ma, Xinyu, et al.
Published: (2025)
by: Ma, Xinyu, et al.
Published: (2025)
Meta-RL Induces Exploration in Language Agents
by: Jiang, Yulun, et al.
Published: (2025)
by: Jiang, Yulun, et al.
Published: (2025)
Similar Items
-
Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling
by: Xiao, Qiao, et al.
Published: (2026) -
When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
by: Wu, Boqian, et al.
Published: (2026) -
Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language Models
by: Jeong, Minbyul, et al.
Published: (2024) -
Reasoning Language Models: A Blueprint
by: Besta, Maciej, et al.
Published: (2025) -
Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
by: Plecko, Drago, et al.
Published: (2025)