ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Hamad, Hassan, Xu, Yingru, Zhao, Liang, Yan, Wenbo, Gyanchandani, Narendra |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reflect before Act: Proactive Error Correction in Language Models
por: Zeng, Qiuhai, et al.
Publicado: (2025)
por: Zeng, Qiuhai, et al.
Publicado: (2025)
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
por: Kokane, Shirley, et al.
Publicado: (2024)
por: Kokane, Shirley, et al.
Publicado: (2024)
Tools Fail: Detecting Silent Errors in Faulty Tools
por: Sun, Jimin, et al.
Publicado: (2024)
por: Sun, Jimin, et al.
Publicado: (2024)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
por: Hu, Xuhao, et al.
Publicado: (2026)
por: Hu, Xuhao, et al.
Publicado: (2026)
Utility-Guided Agent Orchestration for Efficient LLM Tool Use
por: Liu, Boyan, et al.
Publicado: (2026)
por: Liu, Boyan, et al.
Publicado: (2026)
GOOSE Algorithm: A Powerful Optimization Tool for Real-World Engineering Challenges and Beyond
por: Hamad, Rebwar Khalid, et al.
Publicado: (2023)
por: Hamad, Rebwar Khalid, et al.
Publicado: (2023)
UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents
por: Liang, Yijuan, et al.
Publicado: (2026)
por: Liang, Yijuan, et al.
Publicado: (2026)
AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
por: Zhang, Xuan, et al.
Publicado: (2025)
por: Zhang, Xuan, et al.
Publicado: (2025)
Robust Tool Use via Fission-GRPO: Learning to Recover from Execution Errors
por: Zhang, Zhiwei, et al.
Publicado: (2026)
por: Zhang, Zhiwei, et al.
Publicado: (2026)
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
por: Khandelwal, Dinesh, et al.
Publicado: (2026)
por: Khandelwal, Dinesh, et al.
Publicado: (2026)
TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent
por: Sui, Xingyu, et al.
Publicado: (2026)
por: Sui, Xingyu, et al.
Publicado: (2026)
Budget-Aware Tool-Use Enables Effective Agent Scaling
por: Liu, Tengxiao, et al.
Publicado: (2025)
por: Liu, Tengxiao, et al.
Publicado: (2025)
ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
por: Yang, Chen, et al.
Publicado: (2025)
por: Yang, Chen, et al.
Publicado: (2025)
Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use
por: Guo, Ruocheng, et al.
Publicado: (2026)
por: Guo, Ruocheng, et al.
Publicado: (2026)
Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection
por: Zhang, Fanrui, et al.
Publicado: (2025)
por: Zhang, Fanrui, et al.
Publicado: (2025)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
por: Xu, Ningning, et al.
Publicado: (2025)
por: Xu, Ningning, et al.
Publicado: (2025)
ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use
por: Deng, Mengjie, et al.
Publicado: (2025)
por: Deng, Mengjie, et al.
Publicado: (2025)
Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning
por: Gong, Siyu, et al.
Publicado: (2026)
por: Gong, Siyu, et al.
Publicado: (2026)
Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents
por: Zhang, Kaituo, et al.
Publicado: (2026)
por: Zhang, Kaituo, et al.
Publicado: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
por: Li, Renhao, et al.
Publicado: (2025)
por: Li, Renhao, et al.
Publicado: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
por: Feng, Jiazhan, et al.
Publicado: (2025)
por: Feng, Jiazhan, et al.
Publicado: (2025)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
por: Wu, Wenxun, et al.
Publicado: (2025)
por: Wu, Wenxun, et al.
Publicado: (2025)
Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use
por: Cheng, Yize, et al.
Publicado: (2026)
por: Cheng, Yize, et al.
Publicado: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
por: Lu, Jiaxuan, et al.
Publicado: (2026)
por: Lu, Jiaxuan, et al.
Publicado: (2026)
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
por: Jang, Kyochul, et al.
Publicado: (2025)
por: Jang, Kyochul, et al.
Publicado: (2025)
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
por: Xu, Siyuan, et al.
Publicado: (2026)
por: Xu, Siyuan, et al.
Publicado: (2026)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
In-Context Reinforcement Learning for Tool Use in Large Language Models
por: Ye, Yaoqi, et al.
Publicado: (2026)
por: Ye, Yaoqi, et al.
Publicado: (2026)
Logit Dynamics in Softmax Policy Gradient Methods
por: Li, Yingru
Publicado: (2025)
por: Li, Yingru
Publicado: (2025)
ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
por: Fang, Bowen, et al.
Publicado: (2026)
por: Fang, Bowen, et al.
Publicado: (2026)
Don't Fine-Tune, Decode: Syntax Error-Free Tool Use via Constrained Decoding
por: Zhang, Kexun, et al.
Publicado: (2023)
por: Zhang, Kexun, et al.
Publicado: (2023)
AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
por: Zeng, Yirong, et al.
Publicado: (2026)
por: Zeng, Yirong, et al.
Publicado: (2026)
ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue
por: Chung, Hyunseung, et al.
Publicado: (2026)
por: Chung, Hyunseung, et al.
Publicado: (2026)
EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
Reducing Cognitive Overhead in Tool Use via Multi-Small-Agent Reinforcement Learning
por: Wang, Dayu, et al.
Publicado: (2025)
por: Wang, Dayu, et al.
Publicado: (2025)
Advancing Parkinson's Disease Progression Prediction: Comparing Long Short-Term Memory Networks and Kolmogorov-Arnold Networks
por: Roy, Abhinav, et al.
Publicado: (2024)
por: Roy, Abhinav, et al.
Publicado: (2024)
Creative Robot Tool Use by Counterfactual Reasoning
por: Akbulut, M. Tuluhan, et al.
Publicado: (2026)
por: Akbulut, M. Tuluhan, et al.
Publicado: (2026)
MMedAgent: Learning to Use Medical Tools with Multi-modal Agent
por: Li, Binxu, et al.
Publicado: (2024)
por: Li, Binxu, et al.
Publicado: (2024)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
por: Zeng, Yirong, et al.
Publicado: (2025)
por: Zeng, Yirong, et al.
Publicado: (2025)
Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use
por: Chen, Haonan, et al.
Publicado: (2025)
por: Chen, Haonan, et al.
Publicado: (2025)
Ejemplares similares
-
Reflect before Act: Proactive Error Correction in Language Models
por: Zeng, Qiuhai, et al.
Publicado: (2025) -
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
por: Kokane, Shirley, et al.
Publicado: (2024) -
Tools Fail: Detecting Silent Errors in Faulty Tools
por: Sun, Jimin, et al.
Publicado: (2024) -
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
por: Hu, Xuhao, et al.
Publicado: (2026) -
Utility-Guided Agent Orchestration for Efficient LLM Tool Use
por: Liu, Boyan, et al.
Publicado: (2026)