Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Wei, He, Xiaonan, Zhang, Chuheng, Zhang, Xuyun, Xu, Xiaolong, Dou, Wanchun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Filtration for RLHF to Mitigate Noise in Reward Models
par: Zhang, Chuheng, et autres
Publié: (2024)
par: Zhang, Chuheng, et autres
Publié: (2024)
FedLPS: Heterogeneous Federated Learning for Multiple Tasks with Local Parameter Sharing
par: Jia, Yongzhe, et autres
Publié: (2024)
par: Jia, Yongzhe, et autres
Publié: (2024)
DapperFL: Domain Adaptive Federated Learning with Model Fusion Pruning for Edge Devices
par: Jia, Yongzhe, et autres
Publié: (2024)
par: Jia, Yongzhe, et autres
Publié: (2024)
Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
par: Wang, Haoyu, et autres
Publié: (2026)
par: Wang, Haoyu, et autres
Publié: (2026)
Proactive Dialogue Model with Intent Prediction
par: Luo, Yang
Publié: (2026)
par: Luo, Yang
Publié: (2026)
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
par: Nathani, Deepak, et autres
Publié: (2026)
par: Nathani, Deepak, et autres
Publié: (2026)
Affective Multimodal Agents with Proactive Knowledge Grounding for Emotionally Aligned Marketing Dialogue
par: Yu, Lin, et autres
Publié: (2025)
par: Yu, Lin, et autres
Publié: (2025)
Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction
par: Zu, Lipeng, et autres
Publié: (2025)
par: Zu, Lipeng, et autres
Publié: (2025)
IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning
par: Luo, Haohao, et autres
Publié: (2026)
par: Luo, Haohao, et autres
Publié: (2026)
PROPER Agents: Proactivity Driven Personalized Agents for Advancing Knowledge Gap Navigation
par: Kaur, Kirandeep, et autres
Publié: (2026)
par: Kaur, Kirandeep, et autres
Publié: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
par: Zhang, Zijing, et autres
Publié: (2025)
par: Zhang, Zijing, et autres
Publié: (2025)
Reward-RAG: Enhancing RAG with Reward Driven Supervision
par: Nguyen, Thang, et autres
Publié: (2024)
par: Nguyen, Thang, et autres
Publié: (2024)
Stochastic Voronoi Ensembles for Anomaly Detection
par: Cao, Yang, et autres
Publié: (2026)
par: Cao, Yang, et autres
Publié: (2026)
Interactive Speculative Planning: Enhance Agent Efficiency through Co-design of System and User Interface
par: Hua, Wenyue, et autres
Publié: (2024)
par: Hua, Wenyue, et autres
Publié: (2024)
Enhancing Bandit Algorithms with LLMs for Time-varying User Preferences in Streaming Recommendations
par: Shen, Chenglei, et autres
Publié: (2026)
par: Shen, Chenglei, et autres
Publié: (2026)
AgentRM: Enhancing Agent Generalization with Reward Modeling
par: Xia, Yu, et autres
Publié: (2025)
par: Xia, Yu, et autres
Publié: (2025)
Provably Efficient Interactive-Grounded Learning with Personalized Reward
par: Zhang, Mengxiao, et autres
Publié: (2024)
par: Zhang, Mengxiao, et autres
Publié: (2024)
Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning
par: Zhang, Heng, et autres
Publié: (2026)
par: Zhang, Heng, et autres
Publié: (2026)
WavReward: Spoken Dialogue Models With Generalist Reward Evaluators
par: Ji, Shengpeng, et autres
Publié: (2025)
par: Ji, Shengpeng, et autres
Publié: (2025)
Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
par: Lou, Xingzhou, et autres
Publié: (2024)
par: Lou, Xingzhou, et autres
Publié: (2024)
Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards
par: Zhang, Hanping, et autres
Publié: (2025)
par: Zhang, Hanping, et autres
Publié: (2025)
Aligning Spoken Dialogue Models from User Interactions
par: Wu, Anne, et autres
Publié: (2025)
par: Wu, Anne, et autres
Publié: (2025)
ProAgent: Building Proactive Cooperative Agents with Large Language Models
par: Zhang, Ceyao, et autres
Publié: (2023)
par: Zhang, Ceyao, et autres
Publié: (2023)
Pseudo-Siamese Network for Planning in Target-Oriented Proactive Dialogues
par: Kang, Xinyue, et autres
Publié: (2026)
par: Kang, Xinyue, et autres
Publié: (2026)
What Do Latent Action Models Actually Learn?
par: Zhang, Chuheng, et autres
Publié: (2025)
par: Zhang, Chuheng, et autres
Publié: (2025)
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
par: Yao, Yihang, et autres
Publié: (2026)
par: Yao, Yihang, et autres
Publié: (2026)
Freezing of Gait Prediction using Proactive Agent that Learns from Selected Experience and DDQN Algorithm
par: Sukmana, Septian Enggar, et autres
Publié: (2026)
par: Sukmana, Septian Enggar, et autres
Publié: (2026)
UserBench: An Interactive Gym Environment for User-Centric Agents
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Learned Ranking Function: From Short-term Behavior Predictions to Long-term User Satisfaction
par: Wu, Yi, et autres
Publié: (2024)
par: Wu, Yi, et autres
Publié: (2024)
FutureWorld: A Live Reinforcement Learning Environment for Predictive Agents with Real-World Outcome Rewards
par: Han, Zhixin, et autres
Publié: (2026)
par: Han, Zhixin, et autres
Publié: (2026)
AgentFold: Long-Horizon Web Agents with Proactive Context Management
par: Ye, Rui, et autres
Publié: (2025)
par: Ye, Rui, et autres
Publié: (2025)
Measuring User Understanding in Dialogue-based XAI Systems
par: Mindlin, Dimitry, et autres
Publié: (2024)
par: Mindlin, Dimitry, et autres
Publié: (2024)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
par: Wang, Qi, et autres
Publié: (2025)
par: Wang, Qi, et autres
Publié: (2025)
Timing Matters: Enhancing User Experience through Temporal Prediction in Smart Homes
par: Ganatra, Shrey, et autres
Publié: (2024)
par: Ganatra, Shrey, et autres
Publié: (2024)
Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks
par: He, Xiaoyang, et autres
Publié: (2024)
par: He, Xiaoyang, et autres
Publié: (2024)
Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations
par: Hong, Joey, et autres
Publié: (2024)
par: Hong, Joey, et autres
Publié: (2024)
Synthetic Interaction Data for Scalable Personalization in Large Language Models
par: Ma, Yuchen, et autres
Publié: (2026)
par: Ma, Yuchen, et autres
Publié: (2026)
RecoMind: A Reinforcement Learning Framework for Optimizing In-Session User Satisfaction in Recommendation Systems
par: Ayed, Mehdi Ben, et autres
Publié: (2025)
par: Ayed, Mehdi Ben, et autres
Publié: (2025)
Memory Injection Attacks on LLM Agents via Query-Only Interaction
par: Dong, Shen, et autres
Publié: (2025)
par: Dong, Shen, et autres
Publié: (2025)
JAM: Keypoint-Guided Joint Prediction after Classification-Aware Marginal Proposal for Multi-Agent Interaction
par: Lin, Fangze, et autres
Publié: (2025)
par: Lin, Fangze, et autres
Publié: (2025)
Documents similaires
-
Policy Filtration for RLHF to Mitigate Noise in Reward Models
par: Zhang, Chuheng, et autres
Publié: (2024) -
FedLPS: Heterogeneous Federated Learning for Multiple Tasks with Local Parameter Sharing
par: Jia, Yongzhe, et autres
Publié: (2024) -
DapperFL: Domain Adaptive Federated Learning with Model Fusion Pruning for Edge Devices
par: Jia, Yongzhe, et autres
Publié: (2024) -
Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
par: Wang, Haoyu, et autres
Publié: (2026) -
Proactive Dialogue Model with Intent Prediction
par: Luo, Yang
Publié: (2026)