Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Modecrua, Wachiravit, Kaewtawee, Krittanon, Pachtrachai, Krittin, Kraisingkorn, Touchapon |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales
von: Kaewtawee, Krittanon, et al.
Veröffentlicht: (2025)
von: Kaewtawee, Krittanon, et al.
Veröffentlicht: (2025)
ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
von: Temyingyong, Natchaya, et al.
Veröffentlicht: (2025)
von: Temyingyong, Natchaya, et al.
Veröffentlicht: (2025)
From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants
von: Pachtrachai, Krittin, et al.
Veröffentlicht: (2026)
von: Pachtrachai, Krittin, et al.
Veröffentlicht: (2026)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue
von: Chung, Hyunseung, et al.
Veröffentlicht: (2026)
von: Chung, Hyunseung, et al.
Veröffentlicht: (2026)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
von: Zhang, Zhen, et al.
Veröffentlicht: (2026)
von: Zhang, Zhen, et al.
Veröffentlicht: (2026)
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
von: Khandelwal, Dinesh, et al.
Veröffentlicht: (2026)
von: Khandelwal, Dinesh, et al.
Veröffentlicht: (2026)
Assertion-Conditioned Compliance: A Provenance-Aware Vulnerability in Multi-Turn Tool-Calling Agents
von: Waqas, Daud, et al.
Veröffentlicht: (2025)
von: Waqas, Daud, et al.
Veröffentlicht: (2025)
Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
von: Chuang, Yun-Shiuan, et al.
Veröffentlicht: (2026)
von: Chuang, Yun-Shiuan, et al.
Veröffentlicht: (2026)
Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)
von: Knorr, Marius S., et al.
Veröffentlicht: (2026)
von: Knorr, Marius S., et al.
Veröffentlicht: (2026)
Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents
von: Ta, Anh, et al.
Veröffentlicht: (2026)
von: Ta, Anh, et al.
Veröffentlicht: (2026)
Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments
von: Crouse, Maxwell, et al.
Veröffentlicht: (2026)
von: Crouse, Maxwell, et al.
Veröffentlicht: (2026)
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
von: Kim, Wonjoong, et al.
Veröffentlicht: (2026)
von: Kim, Wonjoong, et al.
Veröffentlicht: (2026)
ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
von: Abboud, Elie, et al.
Veröffentlicht: (2026)
von: Abboud, Elie, et al.
Veröffentlicht: (2026)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
von: Yang, Pei, et al.
Veröffentlicht: (2025)
von: Yang, Pei, et al.
Veröffentlicht: (2025)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
von: Jian, Ai, et al.
Veröffentlicht: (2026)
von: Jian, Ai, et al.
Veröffentlicht: (2026)
Turn-based Multi-Agent Reinforcement Learning Model Checking
von: Gross, Dennis
Veröffentlicht: (2025)
von: Gross, Dennis
Veröffentlicht: (2025)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
von: Chai, Huacan, et al.
Veröffentlicht: (2025)
von: Chai, Huacan, et al.
Veröffentlicht: (2025)
ToolRLA: Multiplicative Reward Decomposition for Tool-Integrated Agents
von: Liu, Pengbo
Veröffentlicht: (2026)
von: Liu, Pengbo
Veröffentlicht: (2026)
Reward-Independent Messaging for Decentralized Multi-Agent Reinforcement Learning
von: Yoshida, Naoto, et al.
Veröffentlicht: (2025)
von: Yoshida, Naoto, et al.
Veröffentlicht: (2025)
Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines
von: Zheng, Xuejing, et al.
Veröffentlicht: (2024)
von: Zheng, Xuejing, et al.
Veröffentlicht: (2024)
Optimising Call Centre Operations using Reinforcement Learning: Value Iteration versus Proximal Policy Optimisation
von: Li, Kwong Ho, et al.
Veröffentlicht: (2025)
von: Li, Kwong Ho, et al.
Veröffentlicht: (2025)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
von: Kapoor, Aditya, et al.
Veröffentlicht: (2025)
von: Kapoor, Aditya, et al.
Veröffentlicht: (2025)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
von: Ma, Haozhe, et al.
Veröffentlicht: (2024)
UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents
von: Liang, Yijuan, et al.
Veröffentlicht: (2026)
von: Liang, Yijuan, et al.
Veröffentlicht: (2026)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
von: Chai, Jiajun, et al.
Veröffentlicht: (2025)
von: Chai, Jiajun, et al.
Veröffentlicht: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
von: Wang, Kangrui, et al.
Veröffentlicht: (2025)
von: Wang, Kangrui, et al.
Veröffentlicht: (2025)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
von: Wang, Dayu, et al.
Veröffentlicht: (2025)
von: Wang, Dayu, et al.
Veröffentlicht: (2025)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
von: Wang, Longwen, et al.
Veröffentlicht: (2026)
von: Wang, Longwen, et al.
Veröffentlicht: (2026)
To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling
von: Wu, Qinyuan, et al.
Veröffentlicht: (2026)
von: Wu, Qinyuan, et al.
Veröffentlicht: (2026)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
von: Li, Sijia, et al.
Veröffentlicht: (2025)
von: Li, Sijia, et al.
Veröffentlicht: (2025)
AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents
von: Kurmaz, Mehmet
Veröffentlicht: (2026)
von: Kurmaz, Mehmet
Veröffentlicht: (2026)
Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents
von: Ma, SHengjie, et al.
Veröffentlicht: (2025)
von: Ma, SHengjie, et al.
Veröffentlicht: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
von: Chen, Xingwu, et al.
Veröffentlicht: (2026)
von: Chen, Xingwu, et al.
Veröffentlicht: (2026)
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
von: Abdulhai, Marwa, et al.
Veröffentlicht: (2025)
von: Abdulhai, Marwa, et al.
Veröffentlicht: (2025)
W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2026)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2026)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
von: Chen, Kesheng, et al.
Veröffentlicht: (2025)
von: Chen, Kesheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales
von: Kaewtawee, Krittanon, et al.
Veröffentlicht: (2025) -
ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
von: Temyingyong, Natchaya, et al.
Veröffentlicht: (2025) -
From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants
von: Pachtrachai, Krittin, et al.
Veröffentlicht: (2026) -
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
von: Zhong, Haitian, et al.
Veröffentlicht: (2026) -
ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue
von: Chung, Hyunseung, et al.
Veröffentlicht: (2026)