Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Binghai, Liu, Yantao, Liu, Yuxuan, Tang, Tianyi, Wang, Shenzhi, Gao, Chang, Zheng, Chujie, Zhang, Yichang, Yu, Le, Liu, Shixuan, Gui, Tao, Zhang, Qi, Huang, Xuanjing, Yu, Bowen, Huang, Fei, Lin, Junyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
di: Wang, Shenzhi, et al.
Pubblicazione: (2025)
WorldPM: Scaling Human Preference Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2025)
di: Wang, Binghai, et al.
Pubblicazione: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
di: Zhu, Qin, et al.
Pubblicazione: (2025)
di: Zhu, Qin, et al.
Pubblicazione: (2025)
Soft Adaptive Policy Optimization
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
Language Models can Self-Lengthen to Generate Long Texts
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning
di: Lyu, Chengqi, et al.
Pubblicazione: (2025)
di: Lyu, Chengqi, et al.
Pubblicazione: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)
di: Xiang, Hao, et al.
Pubblicazione: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
di: Li, Renhao, et al.
Pubblicazione: (2025)
di: Li, Renhao, et al.
Pubblicazione: (2025)
Group Sequence Policy Optimization
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
di: Zheng, Chujie, et al.
Pubblicazione: (2025)
When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
di: Liu, Hongcheng, et al.
Pubblicazione: (2025)
di: Liu, Hongcheng, et al.
Pubblicazione: (2025)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
di: Li, Zhaoyan, et al.
Pubblicazione: (2026)
di: Li, Zhaoyan, et al.
Pubblicazione: (2026)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
di: Zhou, Enyu, et al.
Pubblicazione: (2024)
RM-R1: Reward Modeling as Reasoning
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
di: Wang, Bowen, et al.
Pubblicazione: (2026)
di: Wang, Bowen, et al.
Pubblicazione: (2026)
Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning
di: Guo, Jiaxing, et al.
Pubblicazione: (2025)
di: Guo, Jiaxing, et al.
Pubblicazione: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
Bounded and Uniform Energy-based Out-of-distribution Detection for Graphs
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation
di: Huang, Qing, et al.
Pubblicazione: (2026)
di: Huang, Qing, et al.
Pubblicazione: (2026)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
di: Zhang, Xiangxiang, et al.
Pubblicazione: (2025)
di: Zhang, Xiangxiang, et al.
Pubblicazione: (2025)
TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
di: Yu, Fangxu, et al.
Pubblicazione: (2025)
di: Yu, Fangxu, et al.
Pubblicazione: (2025)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
di: Han, Tianyang, et al.
Pubblicazione: (2026)
di: Han, Tianyang, et al.
Pubblicazione: (2026)
START: Self-taught Reasoner with Tools
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
The Flexibility Trap: Why Arbitrary Order Limits Reasoning Potential in Diffusion Language Models
di: Ni, Zanlin, et al.
Pubblicazione: (2026)
di: Ni, Zanlin, et al.
Pubblicazione: (2026)
Attention-Aligned Reasoning for Large Language Models
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
di: Zhang, Hongxiang, et al.
Pubblicazione: (2025)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
di: Liu, Shujun, et al.
Pubblicazione: (2024)
di: Liu, Shujun, et al.
Pubblicazione: (2024)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
di: Qiu, Wenjie, et al.
Pubblicazione: (2025)
di: Qiu, Wenjie, et al.
Pubblicazione: (2025)
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
di: Ding, Ruiyi, et al.
Pubblicazione: (2026)
di: Ding, Ruiyi, et al.
Pubblicazione: (2026)
Beyond Turn Limits: Training Deep Search Agents with Dynamic Context Window
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
di: Zhang, Mohan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2026) -
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025) -
Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2025) -
WorldPM: Scaling Human Preference Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2025) -
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)