PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yunxiao, Liu, Meng, Jiang, Kaiyu, Wen, Bin, Yang, Fan, Gao, Tingting, Liao, Lizi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
par: Ji, Hongru, et autres
Publié: (2026)
par: Ji, Hongru, et autres
Publié: (2026)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement
par: Zhou, Xiaofeng, et autres
Publié: (2025)
par: Zhou, Xiaofeng, et autres
Publié: (2025)
Aligned Multi-View Scripts for Universal Chart-to-Code Generation
par: Zhang, Zhihan, et autres
Publié: (2026)
par: Zhang, Zhihan, et autres
Publié: (2026)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
par: Wang, Peisong, et autres
Publié: (2025)
par: Wang, Peisong, et autres
Publié: (2025)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
par: Lu, Xingyu, et autres
Publié: (2024)
par: Lu, Xingyu, et autres
Publié: (2024)
Empathy Level Alignment via Reinforcement Learning for Empathetic Response Generation
par: Ma, Hui, et autres
Publié: (2024)
par: Ma, Hui, et autres
Publié: (2024)
CTSM: Combining Trait and State Emotions for Empathetic Response Model
par: Yufeng, Wang, et autres
Publié: (2024)
par: Yufeng, Wang, et autres
Publié: (2024)
Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement
par: Zhang, Zhihan, et autres
Publié: (2025)
par: Zhang, Zhihan, et autres
Publié: (2025)
UR$^2$: Unify RAG and Reasoning through Reinforcement Learning
par: Li, Weitao, et autres
Publié: (2025)
par: Li, Weitao, et autres
Publié: (2025)
Markov Chain of Thought for Efficient Mathematical Reasoning
par: Yang, Wen, et autres
Publié: (2024)
par: Yang, Wen, et autres
Publié: (2024)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
par: He, Kaiyu, et autres
Publié: (2025)
par: He, Kaiyu, et autres
Publié: (2025)
Exploiting Emotion-Semantic Correlations for Empathetic Response Generation
par: Yang, Zhou, et autres
Publié: (2024)
par: Yang, Zhou, et autres
Publié: (2024)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
par: Pronesti, Massimiliano, et autres
Publié: (2026)
par: Pronesti, Massimiliano, et autres
Publié: (2026)
A Survey on Neural Question Generation: Methods, Applications, and Prospects
par: Guo, Shasha, et autres
Publié: (2024)
par: Guo, Shasha, et autres
Publié: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
par: Lu, Yao, et autres
Publié: (2026)
par: Lu, Yao, et autres
Publié: (2026)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
par: Wen, Xumeng, et autres
Publié: (2025)
par: Wen, Xumeng, et autres
Publié: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
par: Chen, Mingyang, et autres
Publié: (2025)
par: Chen, Mingyang, et autres
Publié: (2025)
PCQPR: Proactive Conversational Question Planning with Reflection
par: Guo, Shasha, et autres
Publié: (2024)
par: Guo, Shasha, et autres
Publié: (2024)
Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs
par: Zheng, Xiang, et autres
Publié: (2026)
par: Zheng, Xiang, et autres
Publié: (2026)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
par: Wang, Jiaan, et autres
Publié: (2025)
par: Wang, Jiaan, et autres
Publié: (2025)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
par: Chen, Guanxu, et autres
Publié: (2025)
par: Chen, Guanxu, et autres
Publié: (2025)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
par: Yan, Yuchen, et autres
Publié: (2026)
par: Yan, Yuchen, et autres
Publié: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
par: Jiang, Xitai, et autres
Publié: (2026)
par: Jiang, Xitai, et autres
Publié: (2026)
Cause-Aware Empathetic Response Generation via Chain-of-Thought Fine-Tuning
par: Chen, Xinhao, et autres
Publié: (2024)
par: Chen, Xinhao, et autres
Publié: (2024)
STRuCT-LLM: Unifying Tabular and Graph Reasoning with Reinforcement Learning for Semantic Parsing
par: Stoisser, Josefa Lia, et autres
Publié: (2025)
par: Stoisser, Josefa Lia, et autres
Publié: (2025)
Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning
par: Zhang, Xiaotian, et autres
Publié: (2025)
par: Zhang, Xiaotian, et autres
Publié: (2025)
STICKERCONV: Generating Multimodal Empathetic Responses from Scratch
par: Zhang, Yiqun, et autres
Publié: (2024)
par: Zhang, Yiqun, et autres
Publié: (2024)
Emotional Support with LLM-based Empathetic Dialogue Generation
par: Wang, Shiquan, et autres
Publié: (2025)
par: Wang, Shiquan, et autres
Publié: (2025)
Towards Reliable and Empathetic Depression-Diagnosis-Oriented Chats
par: Lan, Kunyao, et autres
Publié: (2024)
par: Lan, Kunyao, et autres
Publié: (2024)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
Triplet-Structured Knowledge Integration for Multi-Turn Medical Reasoning
par: Meng, Zhaohan, et autres
Publié: (2025)
par: Meng, Zhaohan, et autres
Publié: (2025)
ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
par: Fan, Lishui, et autres
Publié: (2025)
par: Fan, Lishui, et autres
Publié: (2025)
SGSH: Stimulate Large Language Models with Skeleton Heuristics for Knowledge Base Question Generation
par: Guo, Shasha, et autres
Publié: (2024)
par: Guo, Shasha, et autres
Publié: (2024)
APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
par: Hu, Yuxuan, et autres
Publié: (2024)
par: Hu, Yuxuan, et autres
Publié: (2024)
Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements
par: Qian, Yushan, et autres
Publié: (2023)
par: Qian, Yushan, et autres
Publié: (2023)
Documents similaires
-
STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
par: Ji, Hongru, et autres
Publié: (2026) -
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
par: Ding, Fei, et autres
Publié: (2026) -
Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement
par: Zhou, Xiaofeng, et autres
Publié: (2025) -
Aligned Multi-View Scripts for Universal Chart-to-Code Generation
par: Zhang, Zhihan, et autres
Publié: (2026) -
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
par: Wang, Peisong, et autres
Publié: (2025)