Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Qihao, Hu, Yue, Lu, Mingzhe, Wu, Jiayue, Liu, Yanbing, Tang, Yuanmin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use
di: Wang, Qihao, et al.
Pubblicazione: (2026)
di: Wang, Qihao, et al.
Pubblicazione: (2026)
The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration
di: Xu, Haoyuan, et al.
Pubblicazione: (2026)
di: Xu, Haoyuan, et al.
Pubblicazione: (2026)
ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
di: Liu, Marianne Menglin, et al.
Pubblicazione: (2025)
di: Liu, Marianne Menglin, et al.
Pubblicazione: (2025)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
di: Huang, Shiting, et al.
Pubblicazione: (2025)
di: Huang, Shiting, et al.
Pubblicazione: (2025)
RCAgent: Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models
di: Wang, Zefan, et al.
Pubblicazione: (2023)
di: Wang, Zefan, et al.
Pubblicazione: (2023)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?
di: Chen, Shiqi, et al.
Pubblicazione: (2026)
di: Chen, Shiqi, et al.
Pubblicazione: (2026)
BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?
di: Chen, Guoxin, et al.
Pubblicazione: (2026)
di: Chen, Guoxin, et al.
Pubblicazione: (2026)
Nexus: Execution-Grounded Multi-Agent Test Oracle Synthesis
di: Huang, Dong, et al.
Pubblicazione: (2025)
di: Huang, Dong, et al.
Pubblicazione: (2025)
QCP: A Practical Separation Logic-based C Program Verification Tool
di: Wu, Xiwei, et al.
Pubblicazione: (2025)
di: Wu, Xiwei, et al.
Pubblicazione: (2025)
Firefly: Illuminating Large-Scale Verified Tool-Call Data Generation from Real APIs
di: Lu, Yuxuan, et al.
Pubblicazione: (2026)
di: Lu, Yuxuan, et al.
Pubblicazione: (2026)
SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration
di: Chen, Jialong, et al.
Pubblicazione: (2026)
di: Chen, Jialong, et al.
Pubblicazione: (2026)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
di: Du, Mingzhe, et al.
Pubblicazione: (2024)
di: Du, Mingzhe, et al.
Pubblicazione: (2024)
SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference
di: Le, Cuong Chi, et al.
Pubblicazione: (2026)
di: Le, Cuong Chi, et al.
Pubblicazione: (2026)
SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
di: Wang, Shuaiqi, et al.
Pubblicazione: (2026)
Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
di: Su, Qisheng, et al.
Pubblicazione: (2026)
di: Su, Qisheng, et al.
Pubblicazione: (2026)
Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
di: Chen, Zejian, et al.
Pubblicazione: (2026)
di: Chen, Zejian, et al.
Pubblicazione: (2026)
Suggesting Code Edits in Interactive Machine Learning Notebooks Using Large Language Models
di: Jin, Bihui, et al.
Pubblicazione: (2025)
di: Jin, Bihui, et al.
Pubblicazione: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
di: Wang, Hanbin, et al.
Pubblicazione: (2025)
di: Wang, Hanbin, et al.
Pubblicazione: (2025)
Measuring the Influence of Incorrect Code on Test Generation
di: Huang, Dong, et al.
Pubblicazione: (2024)
di: Huang, Dong, et al.
Pubblicazione: (2024)
KCoEvo: A Knowledge Graph Augmented Framework for Evolutionary Code Generation
di: Kang, Jiazhen, et al.
Pubblicazione: (2026)
di: Kang, Jiazhen, et al.
Pubblicazione: (2026)
Towards Exception Safety Code Generation with Intermediate Representation Agents Framework
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models
di: Mächtle, Felix, et al.
Pubblicazione: (2026)
di: Mächtle, Felix, et al.
Pubblicazione: (2026)
Seeker: Towards Exception Safety Code Generation with Intermediate Language Agents Framework
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
di: Zhang, Xuanming, et al.
Pubblicazione: (2024)
AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans
di: Zi, Yangtian, et al.
Pubblicazione: (2025)
di: Zi, Yangtian, et al.
Pubblicazione: (2025)
ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification
di: Fang, Yue, et al.
Pubblicazione: (2026)
di: Fang, Yue, et al.
Pubblicazione: (2026)
Benchmarking LLMs for Unit Test Generation from Real-World Functions
di: Huang, Dong, et al.
Pubblicazione: (2025)
di: Huang, Dong, et al.
Pubblicazione: (2025)
DebugBench: Evaluating Debugging Capability of Large Language Models
di: Tian, Runchu, et al.
Pubblicazione: (2024)
di: Tian, Runchu, et al.
Pubblicazione: (2024)
LocAgent: Graph-Guided LLM Agents for Code Localization
di: Chen, Zhaoling, et al.
Pubblicazione: (2025)
di: Chen, Zhaoling, et al.
Pubblicazione: (2025)
MemGovern: Enhancing Code Agents through Learning from Governed Human Experiences
di: Wang, Qihao, et al.
Pubblicazione: (2026)
di: Wang, Qihao, et al.
Pubblicazione: (2026)
WorkflowLLM: Enhancing Workflow Orchestration Capability of Large Language Models
di: Fan, Shengda, et al.
Pubblicazione: (2024)
di: Fan, Shengda, et al.
Pubblicazione: (2024)
Benchmarking Failures in Tool-Augmented Language Models
di: Treviño, Eduardo, et al.
Pubblicazione: (2025)
di: Treviño, Eduardo, et al.
Pubblicazione: (2025)
From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks
di: Fujii, Ryo, et al.
Pubblicazione: (2026)
di: Fujii, Ryo, et al.
Pubblicazione: (2026)
Sanskrit Knowledge-based Systems: Annotation and Computational Tools
di: Terdalkar, Hrishikesh
Pubblicazione: (2024)
di: Terdalkar, Hrishikesh
Pubblicazione: (2024)
Scalable Supervising Software Agents with Patch Reasoner
di: Xu, Junjielong, et al.
Pubblicazione: (2025)
di: Xu, Junjielong, et al.
Pubblicazione: (2025)
Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs
di: Dai, Hankun, et al.
Pubblicazione: (2025)
di: Dai, Hankun, et al.
Pubblicazione: (2025)
The CodeInverter Suite: Control-Flow and Data-Mapping Augmented Binary Decompilation with LLMs
di: Liu, Peipei, et al.
Pubblicazione: (2025)
di: Liu, Peipei, et al.
Pubblicazione: (2025)
Dataflow-Guided Retrieval Augmentation for Repository-Level Code Completion
di: Cheng, Wei, et al.
Pubblicazione: (2024)
di: Cheng, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use
di: Wang, Qihao, et al.
Pubblicazione: (2026) -
The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration
di: Xu, Haoyuan, et al.
Pubblicazione: (2026) -
ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering
di: Liu, Marianne Menglin, et al.
Pubblicazione: (2025) -
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
di: Huang, Shiting, et al.
Pubblicazione: (2025) -
RCAgent: Cloud Root Cause Analysis by Autonomous Agents with Tool-Augmented Large Language Models
di: Wang, Zefan, et al.
Pubblicazione: (2023)