Synthetic Users, Real Differences: an Evaluation Framework for User Simulation in Multi-Turn Conversations
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yu Lu, Yun, Hyokun, Roosta, Tanya, Xiao, Ziang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
di: Ye, Suyu, et al.
Pubblicazione: (2025)
di: Ye, Suyu, et al.
Pubblicazione: (2025)
SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?
di: Dou, Yao, et al.
Pubblicazione: (2025)
di: Dou, Yao, et al.
Pubblicazione: (2025)
Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users
di: Ozolcer, Melik, et al.
Pubblicazione: (2025)
di: Ozolcer, Melik, et al.
Pubblicazione: (2025)
I Think, Therefore I Am Under-Qualified? A Benchmark for Evaluating Linguistic Shibboleth Detection in LLM Hiring Evaluations
di: Kharchenko, Julia, et al.
Pubblicazione: (2025)
di: Kharchenko, Julia, et al.
Pubblicazione: (2025)
Personalized Turn-Level User Conversation Satisfaction Benchmark
di: Wang, Zhefan, et al.
Pubblicazione: (2026)
di: Wang, Zhefan, et al.
Pubblicazione: (2026)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
di: Zheng, Mingqian, et al.
Pubblicazione: (2026)
di: Zheng, Mingqian, et al.
Pubblicazione: (2026)
Know You Before You Speak: User-State Modeling for LLM Personalization in Multi-Turn Conversation
di: Luo, Jiani, et al.
Pubblicazione: (2026)
di: Luo, Jiani, et al.
Pubblicazione: (2026)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)
di: Xiang, Hao, et al.
Pubblicazione: (2025)
A Survey on LLM-based Conversational User Simulation
di: Ni, Bo, et al.
Pubblicazione: (2026)
di: Ni, Bo, et al.
Pubblicazione: (2026)
SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation
di: Shea, Ryan, et al.
Pubblicazione: (2025)
di: Shea, Ryan, et al.
Pubblicazione: (2025)
ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders
di: Meshi, Ofer, et al.
Pubblicazione: (2026)
di: Meshi, Ofer, et al.
Pubblicazione: (2026)
WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
The Order Effect: Investigating Prompt Sensitivity to Input Order in LLMs
di: Guan, Bryan, et al.
Pubblicazione: (2025)
di: Guan, Bryan, et al.
Pubblicazione: (2025)
How Well Do LLMs Represent Values Across Cultures? Empirical Analysis of LLM Responses Based on Hofstede Cultural Dimensions
di: Kharchenko, Julia, et al.
Pubblicazione: (2024)
di: Kharchenko, Julia, et al.
Pubblicazione: (2024)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
di: Tan, Zhaoxuan, et al.
Pubblicazione: (2025)
di: Tan, Zhaoxuan, et al.
Pubblicazione: (2025)
User-Oriented Multi-Turn Dialogue Generation with Tool Use at scale
di: Cho, Jungho, et al.
Pubblicazione: (2026)
di: Cho, Jungho, et al.
Pubblicazione: (2026)
Simulating User Agents for Embodied Conversational-AI
di: Philipov, Daniel, et al.
Pubblicazione: (2024)
di: Philipov, Daniel, et al.
Pubblicazione: (2024)
Evaluating Large Language Models as Generative User Simulators for Conversational Recommendation
di: Yoon, Se-eun, et al.
Pubblicazione: (2024)
di: Yoon, Se-eun, et al.
Pubblicazione: (2024)
Multi-trait User Simulation with Adaptive Decoding for Conversational Task Assistants
di: Ferreira, Rafael, et al.
Pubblicazione: (2024)
di: Ferreira, Rafael, et al.
Pubblicazione: (2024)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2025)
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2025)
Multi-User Chat Assistant (MUCA): a Framework Using LLMs to Facilitate Group Conversations
di: Mao, Manqing, et al.
Pubblicazione: (2024)
di: Mao, Manqing, et al.
Pubblicazione: (2024)
Goal Alignment in LLM-Based User Simulators for Conversational AI
di: Mehri, Shuhaib, et al.
Pubblicazione: (2025)
di: Mehri, Shuhaib, et al.
Pubblicazione: (2025)
Unveiling the Secrets of Engaging Conversations: Factors that Keep Users Hooked on Role-Playing Dialog Agents
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
di: Zhang, Shuai, et al.
Pubblicazione: (2024)
A Speaker Turn-Aware Multi-Task Adversarial Network for Joint User Satisfaction Estimation and Sentiment Analysis
di: Song, Kaisong, et al.
Pubblicazione: (2024)
di: Song, Kaisong, et al.
Pubblicazione: (2024)
The Need for a Socially-Grounded Persona Framework for User Simulation
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2026)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2026)
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
di: Ye, Jing, et al.
Pubblicazione: (2026)
di: Ye, Jing, et al.
Pubblicazione: (2026)
Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations
di: Juneja, Prerna, et al.
Pubblicazione: (2026)
di: Juneja, Prerna, et al.
Pubblicazione: (2026)
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
di: Zhu, Chiwei, et al.
Pubblicazione: (2025)
di: Zhu, Chiwei, et al.
Pubblicazione: (2025)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
di: Wang, Jiayin, et al.
Pubblicazione: (2024)
di: Wang, Jiayin, et al.
Pubblicazione: (2024)
Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors
di: Mehri, Shuhaib, et al.
Pubblicazione: (2026)
di: Mehri, Shuhaib, et al.
Pubblicazione: (2026)
Proactive Guidance of Multi-Turn Conversation in Industrial Search
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
di: Li, Xiaoyu, et al.
Pubblicazione: (2025)
Personality Matters: User Traits Predict LLM Preferences in Multi-Turn Collaborative Tasks
di: Yunusov, Sarfaroz, et al.
Pubblicazione: (2025)
di: Yunusov, Sarfaroz, et al.
Pubblicazione: (2025)
Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions
di: Vlachos, Christos, et al.
Pubblicazione: (2025)
di: Vlachos, Christos, et al.
Pubblicazione: (2025)
The Era of Real-World Human Interaction: RL from User Conversations
di: Jin, Chuanyang, et al.
Pubblicazione: (2025)
di: Jin, Chuanyang, et al.
Pubblicazione: (2025)
Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations
di: Zhang, Lichao, et al.
Pubblicazione: (2024)
di: Zhang, Lichao, et al.
Pubblicazione: (2024)
UserSumBench: A Benchmark Framework for Evaluating User Summarization Approaches
di: Wang, Chao, et al.
Pubblicazione: (2024)
di: Wang, Chao, et al.
Pubblicazione: (2024)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
di: Singh, Anikait, et al.
Pubblicazione: (2025)
di: Singh, Anikait, et al.
Pubblicazione: (2025)
Strength Lies in Differences! Improving Strategy Planning for Non-collaborative Dialogues via Diversified User Simulation
di: Zhang, Tong, et al.
Pubblicazione: (2024)
di: Zhang, Tong, et al.
Pubblicazione: (2024)
Simulating Before Planning: Constructing Intrinsic User World Model for User-Tailored Dialogue Policy Planning
di: He, Tao, et al.
Pubblicazione: (2025)
di: He, Tao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
di: Ye, Suyu, et al.
Pubblicazione: (2025) -
SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?
di: Dou, Yao, et al.
Pubblicazione: (2025) -
Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users
di: Ozolcer, Melik, et al.
Pubblicazione: (2025) -
I Think, Therefore I Am Under-Qualified? A Benchmark for Evaluating Linguistic Shibboleth Detection in LLM Hiring Evaluations
di: Kharchenko, Julia, et al.
Pubblicazione: (2025) -
Personalized Turn-Level User Conversation Satisfaction Benchmark
di: Wang, Zhefan, et al.
Pubblicazione: (2026)