Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
Fuente:
arXiv
Saved in:
| Main Authors: | Du, Huifang, Li, Shuqin, Wu, Minghao, Feng, Xuejing, Li, Yuan-Fang, Wang, Haofen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
Unlocking Proactivity in Task-Oriented Dialogue
by: Zhang, Hongbin, et al.
Published: (2026)
by: Zhang, Hongbin, et al.
Published: (2026)
Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines
by: Zheng, Xuejing, et al.
Published: (2024)
by: Zheng, Xuejing, et al.
Published: (2024)
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
by: Zhang, Yanfei, et al.
Published: (2026)
by: Zhang, Yanfei, et al.
Published: (2026)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
by: Yoon, Deokgyu, et al.
Published: (2026)
by: Yoon, Deokgyu, et al.
Published: (2026)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
by: Zhang, Zhen, et al.
Published: (2026)
by: Zhang, Zhen, et al.
Published: (2026)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
by: Li, Zeqiao, et al.
Published: (2026)
by: Li, Zeqiao, et al.
Published: (2026)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
by: Wang, Xiangyu, et al.
Published: (2026)
by: Wang, Xiangyu, et al.
Published: (2026)
Reasoning Fails Where Step Flow Breaks
by: Xu, Xiaoyu, et al.
Published: (2026)
by: Xu, Xiaoyu, et al.
Published: (2026)
GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning
by: Zhang, Yao, et al.
Published: (2025)
by: Zhang, Yao, et al.
Published: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
by: Fei, Wu, et al.
Published: (2025)
by: Fei, Wu, et al.
Published: (2025)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
by: Ma, Yiran, et al.
Published: (2024)
by: Ma, Yiran, et al.
Published: (2024)
HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues
by: Zhong, Yijie, et al.
Published: (2026)
by: Zhong, Yijie, et al.
Published: (2026)
ATLaS: Agent Tuning via Learning Critical Steps
by: Chen, Zhixun, et al.
Published: (2025)
by: Chen, Zhixun, et al.
Published: (2025)
Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards
by: Yang, Ting, et al.
Published: (2025)
by: Yang, Ting, et al.
Published: (2025)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
by: Zhang, Kaiyi, et al.
Published: (2025)
by: Zhang, Kaiyi, et al.
Published: (2025)
Multi-Step Dialogue Workflow Action Prediction
by: Ramakrishnan, Ramya, et al.
Published: (2023)
by: Ramakrishnan, Ramya, et al.
Published: (2023)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
by: Wu, Yerong, et al.
Published: (2026)
by: Wu, Yerong, et al.
Published: (2026)
Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
by: Chen, Jack, et al.
Published: (2025)
by: Chen, Jack, et al.
Published: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
StepFun-Prover Preview: Let's Think and Verify Step by Step
by: Shang, Shijie, et al.
Published: (2025)
by: Shang, Shijie, et al.
Published: (2025)
Interference-Aware K-Step Reachable Communication in Multi-Agent Reinforcement Learning
by: Cheng, Ziyu, et al.
Published: (2026)
by: Cheng, Ziyu, et al.
Published: (2026)
Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks
by: Vijayvargiya, Sanidhya, et al.
Published: (2026)
by: Vijayvargiya, Sanidhya, et al.
Published: (2026)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
by: Xiong, Weimin, et al.
Published: (2024)
by: Xiong, Weimin, et al.
Published: (2024)
Improving Multi-Domain Task-Oriented Dialogue System with Offline Reinforcement Learning
by: Prajapat, Dharmendra, et al.
Published: (2024)
by: Prajapat, Dharmendra, et al.
Published: (2024)
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
by: Ling Team, et al.
Published: (2025)
by: Ling Team, et al.
Published: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
by: Ding, Zihan, et al.
Published: (2024)
by: Ding, Zihan, et al.
Published: (2024)
One Step Beyond: Feedthrough & Placement-Aware Rectilinear Floorplanner
by: Xu, Zhexuan, et al.
Published: (2025)
by: Xu, Zhexuan, et al.
Published: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
One Step is Enough: Multi-Agent Reinforcement Learning based on One-Step Policy Optimization for Order Dispatch on Ride-Sharing Platforms
by: Zhao, Zijian, et al.
Published: (2025)
by: Zhao, Zijian, et al.
Published: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
by: Rezaei, Mohammad, et al.
Published: (2026)
by: Rezaei, Mohammad, et al.
Published: (2026)
An Improved Strategy for Blood Glucose Control Using Multi-Step Deep Reinforcement Learning
by: Gu, Weiwei, et al.
Published: (2024)
by: Gu, Weiwei, et al.
Published: (2024)
TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
by: Luo, Yihong, et al.
Published: (2026)
by: Luo, Yihong, et al.
Published: (2026)
Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling
by: Liu, Yuchen, et al.
Published: (2026)
by: Liu, Yuchen, et al.
Published: (2026)
HierTOD: A Task-Oriented Dialogue System Driven by Hierarchical Goals
by: Mo, Lingbo, et al.
Published: (2024)
by: Mo, Lingbo, et al.
Published: (2024)
Towards Automatic Evaluation of Task-Oriented Dialogue Flows
by: Mirtaheri, Mehrnoosh, et al.
Published: (2024)
by: Mirtaheri, Mehrnoosh, et al.
Published: (2024)
Graph-Augmented Reasoning: Evolving Step-by-Step Knowledge Graph Retrieval for LLM Reasoning
by: Wu, Wenjie, et al.
Published: (2025)
by: Wu, Wenjie, et al.
Published: (2025)
Inverse Design in Distributed Circuits Using Single-Step Reinforcement Learning
by: Li, Jiayu, et al.
Published: (2025)
by: Li, Jiayu, et al.
Published: (2025)
What Matters for Simulation to Online Reinforcement Learning on Real Robots
by: As, Yarden, et al.
Published: (2026)
by: As, Yarden, et al.
Published: (2026)
AdvDMD: Adversarial Reward Meets DMD For High-Quality Few-Step Generation
by: Wang, Xu, et al.
Published: (2026)
by: Wang, Xu, et al.
Published: (2026)
Similar Items
-
R3-RAG: Learning Step-by-Step Reasoning and Retrieval for LLMs via Reinforcement Learning
by: Li, Yuan, et al.
Published: (2025) -
Unlocking Proactivity in Task-Oriented Dialogue
by: Zhang, Hongbin, et al.
Published: (2026) -
Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines
by: Zheng, Xuejing, et al.
Published: (2024) -
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
by: Zhang, Yanfei, et al.
Published: (2026) -
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
by: Yoon, Deokgyu, et al.
Published: (2026)