One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Bowen, Shi, Taiwei, Kamoi, Ryo, Yuan, Yuan, Taylor, Camillo J., Yang, Longqi, Zhou, Pei, Chen, Sihao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Experiential Reinforcement Learning
di: Shi, Taiwei, et al.
Pubblicazione: (2026)
di: Shi, Taiwei, et al.
Pubblicazione: (2026)
Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction
di: Kamoi, Ryo, et al.
Pubblicazione: (2026)
di: Kamoi, Ryo, et al.
Pubblicazione: (2026)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)
di: Xiang, Hao, et al.
Pubblicazione: (2025)
SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations
di: Chen, Jiangwang, et al.
Pubblicazione: (2026)
di: Chen, Jiangwang, et al.
Pubblicazione: (2026)
Direct Multi-Turn Preference Optimization for Language Agents
di: Shi, Wentao, et al.
Pubblicazione: (2024)
di: Shi, Wentao, et al.
Pubblicazione: (2024)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
Mitigating Conversational Inertia in Multi-Turn Agents
di: Wan, Yang, et al.
Pubblicazione: (2026)
di: Wan, Yang, et al.
Pubblicazione: (2026)
Multi-Turn Multi-Modal Question Clarification for Enhanced Conversational Understanding
di: Ramezan, Kimia, et al.
Pubblicazione: (2025)
di: Ramezan, Kimia, et al.
Pubblicazione: (2025)
Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
di: Jiang, Bowen, et al.
Pubblicazione: (2025)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
di: Guan, Shengyue, et al.
Pubblicazione: (2025)
di: Guan, Shengyue, et al.
Pubblicazione: (2025)
DP-RFT: Learning to Generate Synthetic Text via Differentially Private Reinforcement Fine-Tuning
di: Xu, Fangyuan, et al.
Pubblicazione: (2026)
di: Xu, Fangyuan, et al.
Pubblicazione: (2026)
The Hallucination Tax of Reinforcement Finetuning
di: Song, Linxin, et al.
Pubblicazione: (2025)
di: Song, Linxin, et al.
Pubblicazione: (2025)
PsyPlay: Personality-Infused Role-Playing Conversational Agents
di: Yang, Tao, et al.
Pubblicazione: (2025)
di: Yang, Tao, et al.
Pubblicazione: (2025)
Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows
di: Yu, Tao, et al.
Pubblicazione: (2026)
di: Yu, Tao, et al.
Pubblicazione: (2026)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
di: Zhang, Hanchen, et al.
Pubblicazione: (2025)
di: Zhang, Hanchen, et al.
Pubblicazione: (2025)
LLMs Get Lost In Multi-Turn Conversation
di: Laban, Philippe, et al.
Pubblicazione: (2025)
di: Laban, Philippe, et al.
Pubblicazione: (2025)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026)
di: He, Zhida, et al.
Pubblicazione: (2026)
Do global competitiveness factors impact the marine sustainability practices? An empirical evidence from fisheries sector
di: Mohd Alsaleh, et al.
Pubblicazione: (2024)
di: Mohd Alsaleh, et al.
Pubblicazione: (2024)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
di: Xie, Yuan, et al.
Pubblicazione: (2025)
di: Xie, Yuan, et al.
Pubblicazione: (2025)
C-MTCSD: A Chinese Multi-Turn Conversational Stance Detection Dataset
di: Niu, Fuqiang, et al.
Pubblicazione: (2025)
di: Niu, Fuqiang, et al.
Pubblicazione: (2025)
Towards Rationality in Language and Multimodal Agents: A Survey
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment
di: Tan, Zhewen, et al.
Pubblicazione: (2026)
di: Tan, Zhewen, et al.
Pubblicazione: (2026)
MOA: Multi-Objective Alignment for Role-Playing Agents
di: Liao, Chonghua, et al.
Pubblicazione: (2025)
di: Liao, Chonghua, et al.
Pubblicazione: (2025)
Teaching Language Models To Gather Information Proactively
di: Huang, Tenghao, et al.
Pubblicazione: (2025)
di: Huang, Tenghao, et al.
Pubblicazione: (2025)
Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent
di: Feng, Xueyang, et al.
Pubblicazione: (2025)
di: Feng, Xueyang, et al.
Pubblicazione: (2025)
MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations
di: Chandra, Mohit, et al.
Pubblicazione: (2025)
di: Chandra, Mohit, et al.
Pubblicazione: (2025)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
di: Yuan, Huining, et al.
Pubblicazione: (2025)
di: Yuan, Huining, et al.
Pubblicazione: (2025)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
di: Wei, Quan, et al.
Pubblicazione: (2025)
di: Wei, Quan, et al.
Pubblicazione: (2025)
Distributionally Robust Multi-Agent Reinforcement Learning for Intelligent Traffic Control
di: Pei, Shuwei, et al.
Pubblicazione: (2025)
di: Pei, Shuwei, et al.
Pubblicazione: (2025)
PP-MARL: Efficient Privacy-Preserving Multi-Agent Reinforcement Learning for Cooperative Intelligence in Communications
di: Yuan, Tingting, et al.
Pubblicazione: (2022)
di: Yuan, Tingting, et al.
Pubblicazione: (2022)
Eliciting Behaviors in Multi-Turn Conversations
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
Direct-Inverse Prompting: Analyzing LLMs' Discriminative Capacity in Self-Improving Generation
di: Ahn, Jihyun Janice, et al.
Pubblicazione: (2024)
di: Ahn, Jihyun Janice, et al.
Pubblicazione: (2024)
Turn-based Multi-Agent Reinforcement Learning Model Checking
di: Gross, Dennis
Pubblicazione: (2025)
di: Gross, Dennis
Pubblicazione: (2025)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
di: Kalyan, Vivek, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Experiential Reinforcement Learning
di: Shi, Taiwei, et al.
Pubblicazione: (2026) -
Evaluating LLM-Simulated Conversations in Modeling Inconsistent and Uncollaborative Behaviors in Human Social Interaction
di: Kamoi, Ryo, et al.
Pubblicazione: (2026) -
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
di: Jiang, Bowen, et al.
Pubblicazione: (2024) -
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
di: Liu, Bo, et al.
Pubblicazione: (2025) -
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)