ToolPRMBench: Evaluating and Advancing Process Reward Models for Tool-using Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Dawei, Yao, Yuguang, Tan, Zhen, Liu, Huan, Guo, Ruocheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
di: Kokane, Shirley, et al.
Pubblicazione: (2024)
di: Kokane, Shirley, et al.
Pubblicazione: (2024)
ToolFuzz -- Automated Agent Tool Testing
di: Milev, Ivan, et al.
Pubblicazione: (2025)
di: Milev, Ivan, et al.
Pubblicazione: (2025)
Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools
di: Son, Ha Min, et al.
Pubblicazione: (2025)
di: Son, Ha Min, et al.
Pubblicazione: (2025)
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
di: Li, Yuanyang, et al.
Pubblicazione: (2026)
di: Li, Yuanyang, et al.
Pubblicazione: (2026)
EvolveTool-Bench: Evaluating the Quality of LLM-Generated Tool Libraries as Software Artifacts
di: Kaliyev, Alibek T., et al.
Pubblicazione: (2026)
di: Kaliyev, Alibek T., et al.
Pubblicazione: (2026)
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
di: Li, Zeping, et al.
Pubblicazione: (2026)
di: Li, Zeping, et al.
Pubblicazione: (2026)
Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance
di: Sigdel, Akshey, et al.
Pubblicazione: (2026)
di: Sigdel, Akshey, et al.
Pubblicazione: (2026)
User Centric Evaluation of Code Generation Tools
di: Miah, Tanha, et al.
Pubblicazione: (2024)
di: Miah, Tanha, et al.
Pubblicazione: (2024)
ASA: Training-Free Representation Engineering for Tool-Calling Agents
di: Wang, Youjin, et al.
Pubblicazione: (2026)
di: Wang, Youjin, et al.
Pubblicazione: (2026)
Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents
di: Kovács, Ádám
Pubblicazione: (2026)
di: Kovács, Ádám
Pubblicazione: (2026)
Investigating Tool-Memory Conflicts in Tool-Augmented LLMs
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
MCP-Zero: Active Tool Discovery for Autonomous LLM Agents
di: Fei, Xiang, et al.
Pubblicazione: (2025)
di: Fei, Xiang, et al.
Pubblicazione: (2025)
ParaTool: Shifting Tool Representations from Context to Parameters
di: Yu, Zekai, et al.
Pubblicazione: (2026)
di: Yu, Zekai, et al.
Pubblicazione: (2026)
SynthTools: A Framework for Scaling Synthetic Tools for Agent Development
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
di: Castellani, Tommaso, et al.
Pubblicazione: (2025)
A Tool for Generating Exceptional Behavior Tests With Large Language Models
di: Zhong, Linghan, et al.
Pubblicazione: (2025)
di: Zhong, Linghan, et al.
Pubblicazione: (2025)
The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?
di: Zeng, Yirong, et al.
Pubblicazione: (2026)
di: Zeng, Yirong, et al.
Pubblicazione: (2026)
Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection
di: Mudunuri, Sarat, et al.
Pubblicazione: (2026)
di: Mudunuri, Sarat, et al.
Pubblicazione: (2026)
Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents
di: Winston, Cailin, et al.
Pubblicazione: (2026)
di: Winston, Cailin, et al.
Pubblicazione: (2026)
Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems
di: Xiong, Qian, et al.
Pubblicazione: (2025)
di: Xiong, Qian, et al.
Pubblicazione: (2025)
JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language Agents
di: Ghoshal, Sandip, et al.
Pubblicazione: (2026)
di: Ghoshal, Sandip, et al.
Pubblicazione: (2026)
Graph-Based Self-Healing Tool Routing for Cost-Efficient LLM Agents
di: Bholani, Neeraj
Pubblicazione: (2026)
di: Bholani, Neeraj
Pubblicazione: (2026)
Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
The A-R Behavioral Space: Execution-Level Profiling of Tool-Using Language Model Agents in Organizational Deployment
di: Yu, Shasha, et al.
Pubblicazione: (2026)
di: Yu, Shasha, et al.
Pubblicazione: (2026)
ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems
di: Sigdel, Akshey, et al.
Pubblicazione: (2026)
di: Sigdel, Akshey, et al.
Pubblicazione: (2026)
CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision
di: Lu, Yifei, et al.
Pubblicazione: (2025)
di: Lu, Yifei, et al.
Pubblicazione: (2025)
Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents
di: Dang, Hy, et al.
Pubblicazione: (2026)
di: Dang, Hy, et al.
Pubblicazione: (2026)
MathViz-E: A Case-study in Domain-Specialized Tool-Using Agents
di: Bulusu, Arya, et al.
Pubblicazione: (2024)
di: Bulusu, Arya, et al.
Pubblicazione: (2024)
Automatic Red Teaming LLM-based Agents with Model Context Protocol Tools
di: He, Ping, et al.
Pubblicazione: (2025)
di: He, Ping, et al.
Pubblicazione: (2025)
AgentArcEval: An Architecture Evaluation Method for Foundation Model based Agents
di: Lu, Qinghua, et al.
Pubblicazione: (2025)
di: Lu, Qinghua, et al.
Pubblicazione: (2025)
Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation
di: He, Qingsong, et al.
Pubblicazione: (2025)
di: He, Qingsong, et al.
Pubblicazione: (2025)
An Executable Benchmarking Suite for Tool-Using Agents
di: Zhong, Zhiqing, et al.
Pubblicazione: (2026)
di: Zhong, Zhiqing, et al.
Pubblicazione: (2026)
Breaking the Illusion of Identity in LLM Tooling
di: Miller, Marek
Pubblicazione: (2026)
di: Miller, Marek
Pubblicazione: (2026)
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
di: Hu, Ruida, et al.
Pubblicazione: (2026)
di: Hu, Ruida, et al.
Pubblicazione: (2026)
Open-Source AI-based SE Tools: Opportunities and Challenges of Collaborative Software Learning
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use
di: Chen, Aili, et al.
Pubblicazione: (2026)
di: Chen, Aili, et al.
Pubblicazione: (2026)
Unit Test Generation using Generative AI : A Comparative Performance Analysis of Autogeneration Tools
di: Bhatia, Shreya, et al.
Pubblicazione: (2023)
di: Bhatia, Shreya, et al.
Pubblicazione: (2023)
Evaluation-Driven Development and Operations of LLM Agents: A Process Model and Reference Architecture
di: Xia, Boming, et al.
Pubblicazione: (2024)
di: Xia, Boming, et al.
Pubblicazione: (2024)
Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction
di: Gao, Xingjie, et al.
Pubblicazione: (2026)
di: Gao, Xingjie, et al.
Pubblicazione: (2026)
The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents
di: Yu, Shasha, et al.
Pubblicazione: (2026)
di: Yu, Shasha, et al.
Pubblicazione: (2026)
VQA support to Arabic Language Learning Educational Tool
di: Delassi, Khaled Bachir, et al.
Pubblicazione: (2025)
di: Delassi, Khaled Bachir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
di: Kokane, Shirley, et al.
Pubblicazione: (2024) -
ToolFuzz -- Automated Agent Tool Testing
di: Milev, Ivan, et al.
Pubblicazione: (2025) -
Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools
di: Son, Ha Min, et al.
Pubblicazione: (2025) -
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
di: Li, Yuanyang, et al.
Pubblicazione: (2026) -
EvolveTool-Bench: Evaluating the Quality of LLM-Generated Tool Libraries as Software Artifacts
di: Kaliyev, Alibek T., et al.
Pubblicazione: (2026)