MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Weikang, Wang, Xili, Ma, Chengdi, Kong, Lingbin, Yang, Zhaohua, Tuo, Mingxiang, Shi, Xiaowei, Zhai, Yitao, Cai, Xunliang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can RL Improve Generalization of LLM Agents? An Empirical Study
by: Xi, Zhiheng, et al.
Published: (2026)
by: Xi, Zhiheng, et al.
Published: (2026)
Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
by: Yang, Haojin, et al.
Published: (2026)
by: Yang, Haojin, et al.
Published: (2026)
A non-nested unstructured mesh perspective on highly parallel multilevel smoothed Schwarz preconditioner for linear parametric PDEs
by: Ma, Chengdi
Published: (2024)
by: Ma, Chengdi
Published: (2024)
A Non‐Nested Mesh Perspective on Highly Parallel Multilevel Schwarz Preconditioner
by: Chengdi Ma
Published: (2026)
by: Chengdi Ma
Published: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
by: Cao, Shiyi, et al.
Published: (2025)
by: Cao, Shiyi, et al.
Published: (2025)
Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
by: Guo, Xin, et al.
Published: (2025)
by: Guo, Xin, et al.
Published: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
by: Yang, Rui, et al.
Published: (2026)
by: Yang, Rui, et al.
Published: (2026)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
by: Lu, Keer, et al.
Published: (2025)
by: Lu, Keer, et al.
Published: (2025)
Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling
by: Ding, Yiwen, et al.
Published: (2024)
by: Ding, Yiwen, et al.
Published: (2024)
A high-order rectilinear Lagrangian method based on the geometric conservation law
by: Wang, Xun, et al.
Published: (2026)
by: Wang, Xun, et al.
Published: (2026)
MUA: Mobile Ultra-detailed Animatable Avatars
by: Zhu, Heming, et al.
Published: (2026)
by: Zhu, Heming, et al.
Published: (2026)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
by: Li, Pengxiang, et al.
Published: (2025)
by: Li, Pengxiang, et al.
Published: (2025)
FedMUA: Exploring the Vulnerabilities of Federated Learning to Malicious Unlearning Attacks
by: Chen, Jian, et al.
Published: (2025)
by: Chen, Jian, et al.
Published: (2025)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
by: Ma, Chang, et al.
Published: (2024)
by: Ma, Chang, et al.
Published: (2024)
UserRL: Training Interactive User-Centric Agent via Reinforcement Learning
by: Qian, Cheng, et al.
Published: (2025)
by: Qian, Cheng, et al.
Published: (2025)
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
by: Li, Xuancheng, et al.
Published: (2026)
by: Li, Xuancheng, et al.
Published: (2026)
Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents
by: Cai, Shaofei, et al.
Published: (2025)
by: Cai, Shaofei, et al.
Published: (2025)
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
by: Zhai, Zhiyuan, et al.
Published: (2026)
by: Zhai, Zhiyuan, et al.
Published: (2026)
Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning
by: Hu, Hanjiang, et al.
Published: (2025)
by: Hu, Hanjiang, et al.
Published: (2025)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
by: Wang, Hongyu, et al.
Published: (2025)
by: Wang, Hongyu, et al.
Published: (2025)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
by: Yao, Zhiyuan, et al.
Published: (2026)
by: Yao, Zhiyuan, et al.
Published: (2026)
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
by: Shi, Yaorui, et al.
Published: (2026)
by: Shi, Yaorui, et al.
Published: (2026)
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
by: Li, Yuanhao, et al.
Published: (2025)
by: Li, Yuanhao, et al.
Published: (2025)
A Modified Landau-de Gennes Theory for Smectic Liquid Crystals: Phase Transitions and Structural Transitions
by: Shi, Baoming, et al.
Published: (2024)
by: Shi, Baoming, et al.
Published: (2024)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents
by: Cai, Shaofei, et al.
Published: (2024)
by: Cai, Shaofei, et al.
Published: (2024)
Dependency-Aware Privacy for Multi-turn Agents
by: Anshumaan, Divyam, et al.
Published: (2026)
by: Anshumaan, Divyam, et al.
Published: (2026)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
by: Wang, Dayu, et al.
Published: (2025)
by: Wang, Dayu, et al.
Published: (2025)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
by: Gao, Jiaxuan, et al.
Published: (2026)
by: Gao, Jiaxuan, et al.
Published: (2026)
Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents
by: Wang, Zihao, et al.
Published: (2023)
by: Wang, Zihao, et al.
Published: (2023)
Existence of complete conformal metrics on $\mathbb{R}^n$ with prescribed Q-curvature
by: Li, Mingxiang, et al.
Published: (2025)
by: Li, Mingxiang, et al.
Published: (2025)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
by: Wang, Jiaqi, et al.
Published: (2026)
by: Wang, Jiaqi, et al.
Published: (2026)
Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management
by: Lu, Miao, et al.
Published: (2025)
by: Lu, Miao, et al.
Published: (2025)
CPAFT: A Consistent Parallel Advancing Front Technique for Unstructured Triangular/Tetrahedral Mesh Generation
by: Ma, Chengdi, et al.
Published: (2024)
by: Ma, Chengdi, et al.
Published: (2024)
Greedy Is a Strong Default: Agents as Iterative Optimizers
by: Li, Yitao
Published: (2026)
by: Li, Yitao
Published: (2026)
Cooperative Multi-agent RL with Communication Constraints
by: Xiong, Nuoya, et al.
Published: (2026)
by: Xiong, Nuoya, et al.
Published: (2026)
Evaluating Multi-turn Human-AI Interaction
by: Ding, Shi, et al.
Published: (2026)
by: Ding, Shi, et al.
Published: (2026)
Pixel-Level Reasoning Segmentation via Multi-turn Conversations
by: Cai, Dexian, et al.
Published: (2025)
by: Cai, Dexian, et al.
Published: (2025)
GMTRouter: Personalized LLM Router over Multi-turn User Interactions
by: Xie, Encheng, et al.
Published: (2025)
by: Xie, Encheng, et al.
Published: (2025)
Similar Items
-
Can RL Improve Generalization of LLM Agents? An Empirical Study
by: Xi, Zhiheng, et al.
Published: (2026) -
Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
by: Yang, Haojin, et al.
Published: (2026) -
A non-nested unstructured mesh perspective on highly parallel multilevel smoothed Schwarz preconditioner for linear parametric PDEs
by: Ma, Chengdi
Published: (2024) -
A Non‐Nested Mesh Perspective on Highly Parallel Multilevel Schwarz Preconditioner
by: Chengdi Ma
Published: (2026) -
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
by: Cao, Shiyi, et al.
Published: (2025)