Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Fei, Zhang, Yongkang, Liu, Runhao, Liao, Yuhao, Zeng, Zijian, wang, Sibo, Yang, Huiming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning
par: Feiding, et autres
Publié: (2026)
par: Feiding, et autres
Publié: (2026)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
par: Wang, Yunxiao, et autres
Publié: (2025)
par: Wang, Yunxiao, et autres
Publié: (2025)
KnowCoder-A1: Incentivizing Agentic Reasoning Capability with Outcome Supervision for KBQA
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
AlphaMath Almost Zero: Process Supervision without Process
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
par: Tan, Weiting, et autres
Publié: (2025)
par: Tan, Weiting, et autres
Publié: (2025)
Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search
par: Li, Shuangtao, et autres
Publié: (2025)
par: Li, Shuangtao, et autres
Publié: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
par: Ding, Fei, et autres
Publié: (2025)
par: Ding, Fei, et autres
Publié: (2025)
Incentivizing Strong Reasoning from Weak Supervision
par: Yuan, Yige, et autres
Publié: (2025)
par: Yuan, Yige, et autres
Publié: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models
par: Zheng, Congmin, et autres
Publié: (2025)
par: Zheng, Congmin, et autres
Publié: (2025)
ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation
par: Wang, Zhao, et autres
Publié: (2026)
par: Wang, Zhao, et autres
Publié: (2026)
R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
par: Chen, Yongchao, et autres
Publié: (2025)
par: Chen, Yongchao, et autres
Publié: (2025)
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
par: Zeng, Zijian, et autres
Publié: (2026)
par: Zeng, Zijian, et autres
Publié: (2026)
Supervised Chain of Thought
par: Zhang, Xiang, et autres
Publié: (2024)
par: Zhang, Xiang, et autres
Publié: (2024)
Process Supervision via Verbal Critique Improves Reasoning in Large Language Models
par: Chen, Hao-Yuan
Publié: (2026)
par: Chen, Hao-Yuan
Publié: (2026)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
par: Kim, Kyuyoung, et autres
Publié: (2026)
par: Kim, Kyuyoung, et autres
Publié: (2026)
Combining Supervised Learning and Reinforcement Learning for Multi-Label Classification Tasks with Partial Labels
par: Jia, Zixia, et autres
Publié: (2024)
par: Jia, Zixia, et autres
Publié: (2024)
Latent Reasoning with Supervised Thinking States
par: Amos, Ido, et autres
Publié: (2026)
par: Amos, Ido, et autres
Publié: (2026)
IPS: In-Prompt Process Supervision for Short Video Content Moderation
par: Liu, Mingchao, et autres
Publié: (2024)
par: Liu, Mingchao, et autres
Publié: (2024)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
par: Liang, Feng, et autres
Publié: (2025)
par: Liang, Feng, et autres
Publié: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
par: He, Yang, et autres
Publié: (2026)
par: He, Yang, et autres
Publié: (2026)
Code Execution as Grounded Supervision for LLM Reasoning
par: Jung, Dongwon, et autres
Publié: (2025)
par: Jung, Dongwon, et autres
Publié: (2025)
Relevance to Utility: Process-Supervised Rewrite for RAG
par: Kim, Jaeyoung, et autres
Publié: (2025)
par: Kim, Jaeyoung, et autres
Publié: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
par: Tian, Wei, et autres
Publié: (2026)
par: Tian, Wei, et autres
Publié: (2026)
EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
par: Gull, Ayesha, et autres
Publié: (2025)
par: Gull, Ayesha, et autres
Publié: (2025)
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent
par: Huang, Ziyang, et autres
Publié: (2025)
par: Huang, Ziyang, et autres
Publié: (2025)
Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning
par: Lee, Chaeeun, et autres
Publié: (2026)
par: Lee, Chaeeun, et autres
Publié: (2026)
Linear-Complexity Self-Supervised Learning for Speech Processing
par: Zhang, Shucong, et autres
Publié: (2024)
par: Zhang, Shucong, et autres
Publié: (2024)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
par: Leong, Chak Tou, et autres
Publié: (2026)
par: Leong, Chak Tou, et autres
Publié: (2026)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
par: Wang, Zhen, et autres
Publié: (2025)
par: Wang, Zhen, et autres
Publié: (2025)
Beyond the Trade-off: Self-Supervised Reinforcement Learning for Reasoning Models' Instruction Following
par: Ren, Qingyu, et autres
Publié: (2025)
par: Ren, Qingyu, et autres
Publié: (2025)
SPIN: Self-Supervised Prompt INjection
par: Zhou, Leon, et autres
Publié: (2024)
par: Zhou, Leon, et autres
Publié: (2024)
STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
par: Wu, Jiaao, et autres
Publié: (2026)
par: Wu, Jiaao, et autres
Publié: (2026)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
par: Chen, Nuo, et autres
Publié: (2025)
par: Chen, Nuo, et autres
Publié: (2025)
Documents similaires
-
Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction
par: Ding, Fei, et autres
Publié: (2026) -
Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning
par: Feiding, et autres
Publié: (2026) -
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
par: Ding, Fei, et autres
Publié: (2026) -
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
par: Ding, Fei, et autres
Publié: (2026) -
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
par: Wang, Yunxiao, et autres
Publié: (2025)