Tool-R0: Self-Evolving LLM Agents for Tool-Learning from Zero Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Acikgoz, Emre Can, Qian, Cheng, Hübotter, Jonas, Ji, Heng, Hakkani-Tür, Dilek, Tur, Gokhan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Improving LLM Agents at Test-Time
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
SMART: Self-Aware Agent for Tool Overuse Mitigation
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Current Agents Fail to Leverage World Model as Tool for Foresight
par: Qian, Cheng, et autres
Publié: (2026)
par: Qian, Cheng, et autres
Publié: (2026)
A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
ReSpAct: Harmonizing Reasoning, Speaking, and Acting Towards Building Large Language Model-Based Conversational AI Agents
par: Dongre, Vardhan, et autres
Publié: (2024)
par: Dongre, Vardhan, et autres
Publié: (2024)
Neural Networks for Learnable and Scalable Influence Estimation of Instruction Fine-Tuning Data
par: Agarwal, Ishika, et autres
Publié: (2025)
par: Agarwal, Ishika, et autres
Publié: (2025)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
par: Bozdag, Nimet Beyza, et autres
Publié: (2025)
par: Bozdag, Nimet Beyza, et autres
Publié: (2025)
AcquisitionSynthesis: Targeted Data Generation using Acquisition Functions
par: Agarwal, Ishika, et autres
Publié: (2026)
par: Agarwal, Ishika, et autres
Publié: (2026)
Do LLMs Encode Functional Importance of Reasoning Tokens?
par: Singh, Janvijay, et autres
Publié: (2026)
par: Singh, Janvijay, et autres
Publié: (2026)
Plan Verification for LLM-Based Embodied Task Completion Agents
par: Hariharan, Ananth, et autres
Publié: (2025)
par: Hariharan, Ananth, et autres
Publié: (2025)
Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
TD-EVAL: Revisiting Task-Oriented Dialogue Evaluation by Combining Turn-Level Precision with Dialogue-Level Comparisons
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
SIMU: Selective Influence Machine Unlearning
par: Agarwal, Anu, et autres
Publié: (2025)
par: Agarwal, Anu, et autres
Publié: (2025)
Simulating User Agents for Embodied Conversational-AI
par: Philipov, Daniel, et autres
Publié: (2024)
par: Philipov, Daniel, et autres
Publié: (2024)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
par: Mukherjee, Sagnik, et autres
Publié: (2025)
par: Mukherjee, Sagnik, et autres
Publié: (2025)
User Preference Modeling for Conversational LLM Agents: Weak Rewards from Retrieval-Augmented Interaction
par: Hao, Yuren, et autres
Publié: (2026)
par: Hao, Yuren, et autres
Publié: (2026)
Confidence Estimation for LLM-Based Dialogue State Tracking
par: Sun, Yi-Jyun, et autres
Publié: (2024)
par: Sun, Yi-Jyun, et autres
Publié: (2024)
MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations
par: Dongre, Vardhan, et autres
Publié: (2025)
par: Dongre, Vardhan, et autres
Publié: (2025)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
AURA: A Diagnostic Framework for Tracking User Satisfaction of Interactive Planning Agents
par: Kim, Takyoung, et autres
Publié: (2025)
par: Kim, Takyoung, et autres
Publié: (2025)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
par: Kazi, Taaha, et autres
Publié: (2024)
par: Kazi, Taaha, et autres
Publié: (2024)
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
Do We Need Adam? Surprisingly Strong and Sparse Reinforcement Learning with SGD in LLMs
par: Mukherjee, Sagnik, et autres
Publié: (2026)
par: Mukherjee, Sagnik, et autres
Publié: (2026)
Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue
par: Dongre, Vardhan, et autres
Publié: (2026)
par: Dongre, Vardhan, et autres
Publié: (2026)
Know Your Mistakes: Towards Preventing Overreliance on Task-Oriented Conversational AI Through Accountability Modeling
par: Dey, Suvodip, et autres
Publié: (2025)
par: Dey, Suvodip, et autres
Publié: (2025)
Goal Alignment in LLM-Based User Simulators for Conversational AI
par: Mehri, Shuhaib, et autres
Publié: (2025)
par: Mehri, Shuhaib, et autres
Publié: (2025)
On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
par: Singh, Janvijay, et autres
Publié: (2025)
par: Singh, Janvijay, et autres
Publié: (2025)
Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis
par: Mehri, Shuhaib, et autres
Publié: (2025)
par: Mehri, Shuhaib, et autres
Publié: (2025)
Dialog Flow Induction for Constrainable LLM-Based Chatbots
par: Agrawal, Stuti, et autres
Publié: (2024)
par: Agrawal, Stuti, et autres
Publié: (2024)
YourBench: Easy Custom Evaluation Sets for Everyone
par: Shashidhar, Sumuk, et autres
Publié: (2025)
par: Shashidhar, Sumuk, et autres
Publié: (2025)
ReIn: Conversational Error Recovery with Reasoning Inception
par: Kim, Takyoung, et autres
Publié: (2026)
par: Kim, Takyoung, et autres
Publié: (2026)
Spark: A System for Scientifically Creative Idea Generation
par: Sanyal, Aishik, et autres
Publié: (2025)
par: Sanyal, Aishik, et autres
Publié: (2025)
MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models
par: Ha, Hyeonjeong, et autres
Publié: (2026)
par: Ha, Hyeonjeong, et autres
Publié: (2026)
From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems
par: Rabbani, Parisa, et autres
Publié: (2025)
par: Rabbani, Parisa, et autres
Publié: (2025)
Combinatorial Creativity: A New Frontier in Generalization Abilities
par: Schapiro, Samuel, et autres
Publié: (2025)
par: Schapiro, Samuel, et autres
Publié: (2025)
Aligning LLMs with Individual Preferences via Interaction
par: Wu, Shujin, et autres
Publié: (2024)
par: Wu, Shujin, et autres
Publié: (2024)
Self-Distillation Enables Continual Learning
par: Shenfeld, Idan, et autres
Publié: (2026)
par: Shenfeld, Idan, et autres
Publié: (2026)
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
par: Zhang, Yifei, et autres
Publié: (2026)
par: Zhang, Yifei, et autres
Publié: (2026)
Documents similaires
-
Self-Improving LLM Agents at Test-Time
par: Acikgoz, Emre Can, et autres
Publié: (2025) -
SMART: Self-Aware Agent for Tool Overuse Mitigation
par: Qian, Cheng, et autres
Publié: (2025) -
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025) -
Current Agents Fail to Leverage World Model as Tool for Foresight
par: Qian, Cheng, et autres
Publié: (2026) -
A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
par: Acikgoz, Emre Can, et autres
Publié: (2025)