Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Ting, Chen, Li, Wang, Huimin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
por: Yang, Zixuan, et al.
Publicado: (2026)
por: Yang, Zixuan, et al.
Publicado: (2026)
CARE: Cognitive-reasoning Augmented Reinforcement for Emotional Support Conversation
por: Zhu, Jie, et al.
Publicado: (2025)
por: Zhu, Jie, et al.
Publicado: (2025)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
por: Yin, Shangjian, et al.
Publicado: (2026)
por: Yin, Shangjian, et al.
Publicado: (2026)
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
por: Du, Huifang, et al.
Publicado: (2024)
por: Du, Huifang, et al.
Publicado: (2024)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
por: Wang, Peisong, et al.
Publicado: (2025)
por: Wang, Peisong, et al.
Publicado: (2025)
Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation
por: Cao, Guining, et al.
Publicado: (2026)
por: Cao, Guining, et al.
Publicado: (2026)
Pessimistic Verification for Open Ended Math Questions
por: Huang, Yanxing, et al.
Publicado: (2025)
por: Huang, Yanxing, et al.
Publicado: (2025)
On Creativity and Open-Endedness
por: Soros, L. B., et al.
Publicado: (2024)
por: Soros, L. B., et al.
Publicado: (2024)
The Colorful Future of LLMs: Evaluating and Improving LLMs as Emotional Supporters for Queer Youth
por: Lissak, Shir, et al.
Publicado: (2024)
por: Lissak, Shir, et al.
Publicado: (2024)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
por: Wang, Pengkai, et al.
Publicado: (2025)
por: Wang, Pengkai, et al.
Publicado: (2025)
Emergence of Collective Open-Ended Exploration from Decentralized Meta-Reinforcement Learning
por: Bornemann, Richard, et al.
Publicado: (2023)
por: Bornemann, Richard, et al.
Publicado: (2023)
CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics
por: Nagar, Aishik, et al.
Publicado: (2026)
por: Nagar, Aishik, et al.
Publicado: (2026)
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
por: Qu, Ao, et al.
Publicado: (2026)
por: Qu, Ao, et al.
Publicado: (2026)
Towards Open-Ended Discovery for Low-Resource NLP
por: Dossou, Bonaventure F. P., et al.
Publicado: (2025)
por: Dossou, Bonaventure F. P., et al.
Publicado: (2025)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
por: Demirtaş, Mehmet Arif, et al.
Publicado: (2025)
por: Demirtaş, Mehmet Arif, et al.
Publicado: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
por: Guo, Zhihan, et al.
Publicado: (2025)
por: Guo, Zhihan, et al.
Publicado: (2025)
Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards
por: Verma, Tanvi, et al.
Publicado: (2026)
por: Verma, Tanvi, et al.
Publicado: (2026)
Autotelic Reinforcement Learning: Exploring Intrinsic Motivations for Skill Acquisition in Open-Ended Environments
por: Srivastava, Prakhar, et al.
Publicado: (2025)
por: Srivastava, Prakhar, et al.
Publicado: (2025)
Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning
por: Yuan, Jiahao, et al.
Publicado: (2025)
por: Yuan, Jiahao, et al.
Publicado: (2025)
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
por: Yin, Ming, et al.
Publicado: (2025)
por: Yin, Ming, et al.
Publicado: (2025)
Luban: Building Open-Ended Creative Agents via Autonomous Embodied Verification
por: Guo, Yuxuan, et al.
Publicado: (2024)
por: Guo, Yuxuan, et al.
Publicado: (2024)
LearnLens: An AI-Enhanced Dashboard to Support Teachers in Open-Ended Classrooms
por: Srivastava, Namrata, et al.
Publicado: (2025)
por: Srivastava, Namrata, et al.
Publicado: (2025)
AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
por: Zheng, Haizhong, et al.
Publicado: (2026)
por: Zheng, Haizhong, et al.
Publicado: (2026)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
por: Wen, Xumeng, et al.
Publicado: (2025)
por: Wen, Xumeng, et al.
Publicado: (2025)
StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
por: Tan, Weihao, et al.
Publicado: (2025)
por: Tan, Weihao, et al.
Publicado: (2025)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
por: Carlsson, Fredrik, et al.
Publicado: (2024)
por: Carlsson, Fredrik, et al.
Publicado: (2024)
Affective Flow Language Model for Emotional Support Conversation
por: Zou, Chenghui, et al.
Publicado: (2026)
por: Zou, Chenghui, et al.
Publicado: (2026)
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
por: Weng, Zhaotian, et al.
Publicado: (2026)
por: Weng, Zhaotian, et al.
Publicado: (2026)
LLM Agents Beyond Utility: An Open-Ended Perspective
por: Nachkov, Asen, et al.
Publicado: (2025)
por: Nachkov, Asen, et al.
Publicado: (2025)
Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation
por: Zhai, Shaopeng, et al.
Publicado: (2023)
por: Zhai, Shaopeng, et al.
Publicado: (2023)
Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards
por: Lara, Luis, et al.
Publicado: (2026)
por: Lara, Luis, et al.
Publicado: (2026)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
por: Schlaginhaufen, Andreas, et al.
Publicado: (2024)
por: Schlaginhaufen, Andreas, et al.
Publicado: (2024)
Emotion-Agent: Unsupervised Deep Reinforcement Learning with Distribution-Prototype Reward for Continuous Emotional EEG Analysis
por: Zhou, Zhihao, et al.
Publicado: (2024)
por: Zhou, Zhihao, et al.
Publicado: (2024)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
por: Yao, Yi, et al.
Publicado: (2026)
por: Yao, Yi, et al.
Publicado: (2026)
MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs
por: Yu, Yuechun, et al.
Publicado: (2025)
por: Yu, Yuechun, et al.
Publicado: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
A Definition of Open-Ended Learning Problems for Goal-Conditioned Agents
por: Sigaud, Olivier, et al.
Publicado: (2023)
por: Sigaud, Olivier, et al.
Publicado: (2023)
Unveiling the Significance of Toddler-Inspired Reward Transition in Goal-Oriented Reinforcement Learning
por: Park, Junseok, et al.
Publicado: (2024)
por: Park, Junseok, et al.
Publicado: (2024)
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
por: Lin, Lanbo, et al.
Publicado: (2026)
por: Lin, Lanbo, et al.
Publicado: (2026)
Ejemplares similares
-
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025) -
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
por: Yang, Zixuan, et al.
Publicado: (2026) -
CARE: Cognitive-reasoning Augmented Reinforcement for Emotional Support Conversation
por: Zhu, Jie, et al.
Publicado: (2025) -
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
por: Yin, Shangjian, et al.
Publicado: (2026) -
Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue
por: Du, Huifang, et al.
Publicado: (2024)