Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
Fuente:
arXiv
Salvato in:
| Autori principali: | Modecrua, Wachiravit, Kaewtawee, Krittanon, Pachtrachai, Krittin, Kraisingkorn, Touchapon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales
di: Kaewtawee, Krittanon, et al.
Pubblicazione: (2025)
di: Kaewtawee, Krittanon, et al.
Pubblicazione: (2025)
ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
di: Temyingyong, Natchaya, et al.
Pubblicazione: (2025)
di: Temyingyong, Natchaya, et al.
Pubblicazione: (2025)
From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants
di: Pachtrachai, Krittin, et al.
Pubblicazione: (2026)
di: Pachtrachai, Krittin, et al.
Pubblicazione: (2026)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
di: Zhong, Haitian, et al.
Pubblicazione: (2026)
ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue
di: Chung, Hyunseung, et al.
Pubblicazione: (2026)
di: Chung, Hyunseung, et al.
Pubblicazione: (2026)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
di: Khandelwal, Dinesh, et al.
Pubblicazione: (2026)
di: Khandelwal, Dinesh, et al.
Pubblicazione: (2026)
Assertion-Conditioned Compliance: A Provenance-Aware Vulnerability in Multi-Turn Tool-Calling Agents
di: Waqas, Daud, et al.
Pubblicazione: (2025)
di: Waqas, Daud, et al.
Pubblicazione: (2025)
Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
di: Chuang, Yun-Shiuan, et al.
Pubblicazione: (2026)
di: Chuang, Yun-Shiuan, et al.
Pubblicazione: (2026)
Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)
di: Knorr, Marius S., et al.
Pubblicazione: (2026)
di: Knorr, Marius S., et al.
Pubblicazione: (2026)
Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents
di: Ta, Anh, et al.
Pubblicazione: (2026)
di: Ta, Anh, et al.
Pubblicazione: (2026)
Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments
di: Crouse, Maxwell, et al.
Pubblicazione: (2026)
di: Crouse, Maxwell, et al.
Pubblicazione: (2026)
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
di: Kim, Wonjoong, et al.
Pubblicazione: (2026)
di: Kim, Wonjoong, et al.
Pubblicazione: (2026)
ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning
di: Abboud, Elie, et al.
Pubblicazione: (2026)
di: Abboud, Elie, et al.
Pubblicazione: (2026)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
di: Zhang, Hanchen, et al.
Pubblicazione: (2025)
di: Zhang, Hanchen, et al.
Pubblicazione: (2025)
TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas
di: Jian, Ai, et al.
Pubblicazione: (2026)
di: Jian, Ai, et al.
Pubblicazione: (2026)
Turn-based Multi-Agent Reinforcement Learning Model Checking
di: Gross, Dennis
Pubblicazione: (2025)
di: Gross, Dennis
Pubblicazione: (2025)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
di: Chai, Huacan, et al.
Pubblicazione: (2025)
di: Chai, Huacan, et al.
Pubblicazione: (2025)
ToolRLA: Multiplicative Reward Decomposition for Tool-Integrated Agents
di: Liu, Pengbo
Pubblicazione: (2026)
di: Liu, Pengbo
Pubblicazione: (2026)
Reward-Independent Messaging for Decentralized Multi-Agent Reinforcement Learning
di: Yoshida, Naoto, et al.
Pubblicazione: (2025)
di: Yoshida, Naoto, et al.
Pubblicazione: (2025)
Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines
di: Zheng, Xuejing, et al.
Pubblicazione: (2024)
di: Zheng, Xuejing, et al.
Pubblicazione: (2024)
Optimising Call Centre Operations using Reinforcement Learning: Value Iteration versus Proximal Policy Optimisation
di: Li, Kwong Ho, et al.
Pubblicazione: (2025)
di: Li, Kwong Ho, et al.
Pubblicazione: (2025)
Redistributing Rewards Across Time and Agents for Multi-Agent Reinforcement Learning
di: Kapoor, Aditya, et al.
Pubblicazione: (2025)
di: Kapoor, Aditya, et al.
Pubblicazione: (2025)
Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
di: Ma, Haozhe, et al.
Pubblicazione: (2024)
UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents
di: Liang, Yijuan, et al.
Pubblicazione: (2026)
di: Liang, Yijuan, et al.
Pubblicazione: (2026)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
di: Chai, Jiajun, et al.
Pubblicazione: (2025)
di: Chai, Jiajun, et al.
Pubblicazione: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
di: Wang, Dayu, et al.
Pubblicazione: (2025)
di: Wang, Dayu, et al.
Pubblicazione: (2025)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
di: Wan, Yanming, et al.
Pubblicazione: (2025)
di: Wan, Yanming, et al.
Pubblicazione: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
di: Wang, Longwen, et al.
Pubblicazione: (2026)
di: Wang, Longwen, et al.
Pubblicazione: (2026)
To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling
di: Wu, Qinyuan, et al.
Pubblicazione: (2026)
di: Wu, Qinyuan, et al.
Pubblicazione: (2026)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
di: Li, Sijia, et al.
Pubblicazione: (2025)
di: Li, Sijia, et al.
Pubblicazione: (2025)
AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents
di: Kurmaz, Mehmet
Pubblicazione: (2026)
di: Kurmaz, Mehmet
Pubblicazione: (2026)
Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents
di: Ma, SHengjie, et al.
Pubblicazione: (2025)
di: Ma, SHengjie, et al.
Pubblicazione: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
di: Chen, Xingwu, et al.
Pubblicazione: (2026)
di: Chen, Xingwu, et al.
Pubblicazione: (2026)
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
di: Abdulhai, Marwa, et al.
Pubblicazione: (2025)
di: Abdulhai, Marwa, et al.
Pubblicazione: (2025)
W&D:Scaling Parallel Tool Calling for Efficient Deep Research Agents
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2026)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2026)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cloning a Conversational Voice AI Agent from Call\,Recording Datasets for Telesales
di: Kaewtawee, Krittanon, et al.
Pubblicazione: (2025) -
ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
di: Temyingyong, Natchaya, et al.
Pubblicazione: (2025) -
From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants
di: Pachtrachai, Krittin, et al.
Pubblicazione: (2026) -
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
di: Zhong, Haitian, et al.
Pubblicazione: (2026) -
ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue
di: Chung, Hyunseung, et al.
Pubblicazione: (2026)