Dream to Chat: Model-based Reinforcement Learning on Dialogues with User Belief Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yue, Wang, Xiaoyu, Wang, Dan, Jiang, Zhonglin, Gu, Qingqing, Chen, Teng, Xi, Ningyuan, Qu, Jinxian, Chen, Yong, Ji, Luo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-Party Supervised Fine-tuning of Language Models for Multi-Party Dialogue Generation
by: Wang, Xiaoyu, et al.
Published: (2024)
by: Wang, Xiaoyu, et al.
Published: (2024)
MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning
by: Xi, Ningyuan, et al.
Published: (2024)
by: Xi, Ningyuan, et al.
Published: (2024)
From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents
by: Qu, Jinxian, et al.
Published: (2026)
by: Qu, Jinxian, et al.
Published: (2026)
Convert Language Model into a Value-based Strategic Planner
by: Wang, Xiaoyu, et al.
Published: (2025)
by: Wang, Xiaoyu, et al.
Published: (2025)
Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval
by: Ji, Luo, et al.
Published: (2024)
by: Ji, Luo, et al.
Published: (2024)
FiSMiness: A Finite State Machine Based Paradigm for Emotional Support Conversations
by: Zhao, Yue, et al.
Published: (2025)
by: Zhao, Yue, et al.
Published: (2025)
Chain-of-Conceptual-Thought Elicits Daily Conversation in Large Language Models
by: Gu, Qingqing, et al.
Published: (2025)
by: Gu, Qingqing, et al.
Published: (2025)
Making Language Model a Hierarchical Classifier
by: Wang, Yihong, et al.
Published: (2025)
by: Wang, Yihong, et al.
Published: (2025)
LaMsS: When Large Language Models Meet Self-Skepticism
by: Wu, Yetao, et al.
Published: (2024)
by: Wu, Yetao, et al.
Published: (2024)
A Practice of Post-Training on Llama-3 70B with Optimal Selection of Additional Language Mixture Ratio
by: Xi, Ningyuan, et al.
Published: (2024)
by: Xi, Ningyuan, et al.
Published: (2024)
Learn-to-learn on Arbitrary Textual Conditioning: A Hypernetwork-Driven Meta-Gated LLM
by: Ji, Luo, et al.
Published: (2026)
by: Ji, Luo, et al.
Published: (2026)
Efficient Rationale-based Retrieval: On-policy Distillation from Generative Rerankers based on JEPA
by: Chen, Teng, et al.
Published: (2026)
by: Chen, Teng, et al.
Published: (2026)
M3-JEPA: Multimodal Alignment via Multi-gate MoE based on the Joint-Embedding Predictive Architecture
by: Lei, Hongyang, et al.
Published: (2024)
by: Lei, Hongyang, et al.
Published: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
by: Qu, Mengxue, et al.
Published: (2024)
by: Qu, Mengxue, et al.
Published: (2024)
WavChat: A Survey of Spoken Dialogue Models
by: Ji, Shengpeng, et al.
Published: (2024)
by: Ji, Shengpeng, et al.
Published: (2024)
Conceptual Belief-Informed Reinforcement Learning
by: Gu, Xingrui, et al.
Published: (2024)
by: Gu, Xingrui, et al.
Published: (2024)
Generative Reliability-Based Design Optimization Using In-Context Learning Capabilities of Large Language Models
by: Jiang, Zhonglin, et al.
Published: (2025)
by: Jiang, Zhonglin, et al.
Published: (2025)
Language Models that Think, Chat Better
by: Bhaskar, Adithya, et al.
Published: (2025)
by: Bhaskar, Adithya, et al.
Published: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
by: Chen, Yan, et al.
Published: (2025)
by: Chen, Yan, et al.
Published: (2025)
DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models
by: Jia, Emily Yue-Ting, et al.
Published: (2026)
by: Jia, Emily Yue-Ting, et al.
Published: (2026)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
by: Luo, Xiang, et al.
Published: (2024)
by: Luo, Xiang, et al.
Published: (2024)
ChatModel: Automating Reference Model Design and Verification with LLMs
by: Ye, Jianmin, et al.
Published: (2025)
by: Ye, Jianmin, et al.
Published: (2025)
DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation
by: Jiang, Xin, et al.
Published: (2026)
by: Jiang, Xin, et al.
Published: (2026)
Improving Vision-Language-Action Model with Online Reinforcement Learning
by: Guo, Yanjiang, et al.
Published: (2025)
by: Guo, Yanjiang, et al.
Published: (2025)
Reinforcement Learning for Intensity Control: An Application to Choice-Based Network Revenue Management
by: Meng, Huiling, et al.
Published: (2024)
by: Meng, Huiling, et al.
Published: (2024)
The Use of Binary Choice Forests to Model and Estimate Discrete Choices
by: Chen, Ningyuan, et al.
Published: (2019)
by: Chen, Ningyuan, et al.
Published: (2019)
Contextual Optimization under Covariate Shift: A Robust Approach by Intersecting Wasserstein Balls
by: Wang, Tianyu, et al.
Published: (2024)
by: Wang, Tianyu, et al.
Published: (2024)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
by: Wang, Jian, et al.
Published: (2024)
by: Wang, Jian, et al.
Published: (2024)
DreamStruct: Understanding Slides and User Interfaces via Synthetic Data Generation
by: Peng, Yi-Hao, et al.
Published: (2024)
by: Peng, Yi-Hao, et al.
Published: (2024)
A Numerical Study of Multiple Oblique Impacts on Carbon Fiber‐Reinforced Polymer Laminates Based on Discrete Crack Model
by: Qingqing Shang, et al.
Published: (2025)
by: Qingqing Shang, et al.
Published: (2025)
Belief-Aware VLM Model for Human-like Reasoning
by: Nayak, Anshul, et al.
Published: (2026)
by: Nayak, Anshul, et al.
Published: (2026)
HAM-TTS: Hierarchical Acoustic Modeling for Token-Based Zero-Shot Text-to-Speech with Model and Data Scaling
by: Wang, Chunhui, et al.
Published: (2024)
by: Wang, Chunhui, et al.
Published: (2024)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
by: Chen, Yifu, et al.
Published: (2025)
by: Chen, Yifu, et al.
Published: (2025)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
by: Zhang, Jensen, et al.
Published: (2025)
by: Zhang, Jensen, et al.
Published: (2025)
ChatASU: Evoking LLM's Reflexion to Truly Understand Aspect Sentiment in Dialogues
by: Liu, Yiding, et al.
Published: (2024)
by: Liu, Yiding, et al.
Published: (2024)
DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing
by: Lee, Vint, et al.
Published: (2023)
by: Lee, Vint, et al.
Published: (2023)
Heterogeneous User Modeling for LLM-based Recommendation
by: Bao, Honghui, et al.
Published: (2025)
by: Bao, Honghui, et al.
Published: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
by: Zeng, Chang, et al.
Published: (2024)
by: Zeng, Chang, et al.
Published: (2024)
Understanding User Satisfaction and Engagement with an Online Historical and Cultural Game from a User Experience Perspective
by: Wenhua Zheng, et al.
Published: (2024)
by: Wenhua Zheng, et al.
Published: (2024)
Learning Agent-based Modeling with LLM Companions: Experiences of Novices and Experts Using ChatGPT & NetLogo Chat
by: Chen, John, et al.
Published: (2024)
by: Chen, John, et al.
Published: (2024)
Similar Items
-
Multi-Party Supervised Fine-tuning of Language Models for Multi-Party Dialogue Generation
by: Wang, Xiaoyu, et al.
Published: (2024) -
MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning
by: Xi, Ningyuan, et al.
Published: (2024) -
From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents
by: Qu, Jinxian, et al.
Published: (2026) -
Convert Language Model into a Value-based Strategic Planner
by: Wang, Xiaoyu, et al.
Published: (2025) -
Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval
by: Ji, Luo, et al.
Published: (2024)