An Executable Benchmarking Suite for Tool-Using Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Zhiqing, Ye, Zhijing, Wang, Jiamin, Yu, Xiaodong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Governed Evolution of Agent Runtimes through Executable Operational Cognition
di: Garralda-Barrio, Mariano
Pubblicazione: (2026)
di: Garralda-Barrio, Mariano
Pubblicazione: (2026)
From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work
di: Rosen, Josh, et al.
Pubblicazione: (2026)
di: Rosen, Josh, et al.
Pubblicazione: (2026)
Exploring the Potential of Conversational Test Suite Based Program Repair on SWE-bench
di: Cheshkov, Anton, et al.
Pubblicazione: (2024)
di: Cheshkov, Anton, et al.
Pubblicazione: (2024)
AgentGit: A Version Control Framework for Reliable and Scalable LLM-Powered Multi-Agent Systems
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
El Agente Gráfico: Structured Execution Graphs for Scientific Agents
di: Bai, Jiaru, et al.
Pubblicazione: (2026)
di: Bai, Jiaru, et al.
Pubblicazione: (2026)
Trajectory Supervision for Continual Tool-Use Learning in LLMs
di: Reddy, Vishnu Vardhan, et al.
Pubblicazione: (2026)
di: Reddy, Vishnu Vardhan, et al.
Pubblicazione: (2026)
SemAgent: A Semantics Aware Program Repair Agent
di: Pabba, Anvith, et al.
Pubblicazione: (2025)
di: Pabba, Anvith, et al.
Pubblicazione: (2025)
Self-Evolving Multi-Agent Collaboration Networks for Software Development
di: Hu, Yue, et al.
Pubblicazione: (2024)
di: Hu, Yue, et al.
Pubblicazione: (2024)
Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents
di: Bhardwaj, Varun Pratap
Pubblicazione: (2026)
di: Bhardwaj, Varun Pratap
Pubblicazione: (2026)
Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension
di: Srinivasan, Vasundra
Pubblicazione: (2026)
di: Srinivasan, Vasundra
Pubblicazione: (2026)
Facilitating Trustworthy Human-Agent Collaboration in LLM-based Multi-Agent System oriented Software Engineering
di: Ronanki, Krishna
Pubblicazione: (2025)
di: Ronanki, Krishna
Pubblicazione: (2025)
Affordance Representation and Recognition for Autonomous Agents
di: Gidey, Habtom Kahsay, et al.
Pubblicazione: (2025)
di: Gidey, Habtom Kahsay, et al.
Pubblicazione: (2025)
Spec Kit Agents: Context-Grounded Agentic Workflows
di: Taghavi, Pardis, et al.
Pubblicazione: (2026)
di: Taghavi, Pardis, et al.
Pubblicazione: (2026)
LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems
di: Prakash, Sunil
Pubblicazione: (2026)
di: Prakash, Sunil
Pubblicazione: (2026)
RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection
di: Abuzakuk, Sami, et al.
Pubblicazione: (2026)
di: Abuzakuk, Sami, et al.
Pubblicazione: (2026)
Resolving Java Code Repository Issues with iSWE Agent
di: Ganhotra, Jatin, et al.
Pubblicazione: (2026)
di: Ganhotra, Jatin, et al.
Pubblicazione: (2026)
Multi-Agent LLM Committees for Autonomous Software Beta Testing
di: Karanam, Sumanth Bharadwaj Hachalli, et al.
Pubblicazione: (2025)
di: Karanam, Sumanth Bharadwaj Hachalli, et al.
Pubblicazione: (2025)
Qualixar OS: A Universal Operating System for AI Agent Orchestration
di: Bhardwaj, Varun Pratap
Pubblicazione: (2026)
di: Bhardwaj, Varun Pratap
Pubblicazione: (2026)
The Specification Gap: Coordination Failure Under Partial Knowledge in Code Agents
di: Sartori, Camilo Chacón
Pubblicazione: (2026)
di: Sartori, Camilo Chacón
Pubblicazione: (2026)
EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids
di: Muszyński, Jakub, et al.
Pubblicazione: (2025)
di: Muszyński, Jakub, et al.
Pubblicazione: (2025)
Nexus: A Lightweight and Scalable Multi-Agent Framework for Complex Tasks Automation
di: Sami, Humza, et al.
Pubblicazione: (2025)
di: Sami, Humza, et al.
Pubblicazione: (2025)
Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol
di: Srinivasan, Vasundra
Pubblicazione: (2026)
di: Srinivasan, Vasundra
Pubblicazione: (2026)
Assessing and Enhancing the Robustness of LLM-based Multi-Agent Systems Through Chaos Engineering
di: Owotogbe, Joshua
Pubblicazione: (2025)
di: Owotogbe, Joshua
Pubblicazione: (2025)
A Research Agenda on Agents and Software Engineering: Outcomes from the Rio A2SE Seminar
di: Taibi, Davide, et al.
Pubblicazione: (2026)
di: Taibi, Davide, et al.
Pubblicazione: (2026)
AI-Generated Code Is Not Reproducible (Yet): An Empirical Study of Dependency Gaps in LLM-Based Coding Agents
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
Accelerating Drug Discovery Through Agentic AI: A Multi-Agent Approach to Laboratory Automation in the DMTA Cycle
di: Fehlis, Yao, et al.
Pubblicazione: (2025)
di: Fehlis, Yao, et al.
Pubblicazione: (2025)
IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai
di: Lu, Pengju
Pubblicazione: (2025)
di: Lu, Pengju
Pubblicazione: (2025)
Operationalizing Reconstructive Authority: Runtime Construction, Dependency Resolution, and Execution Gating in Autonomous Agent Systems
di: TraslaIA, Marcelo Fernandez -
Pubblicazione: (2026)
di: TraslaIA, Marcelo Fernandez -
Pubblicazione: (2026)
Computational Foundations for Strategic Coopetition: Formalizing Interdependence and Complementarity
di: Pant, Vik, et al.
Pubblicazione: (2025)
di: Pant, Vik, et al.
Pubblicazione: (2025)
SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
di: Xiang, Yanzheng, et al.
Pubblicazione: (2025)
di: Xiang, Yanzheng, et al.
Pubblicazione: (2025)
Sibyl-AutoResearch: Autonomous Research Needs Self-Evolving Trial-and-Error Harnesses, Not Paper Generators
di: Wang, Chengcheng, et al.
Pubblicazione: (2026)
di: Wang, Chengcheng, et al.
Pubblicazione: (2026)
Multi-Agent Collaboration via Cross-Team Orchestration
di: Du, Zhuoyun, et al.
Pubblicazione: (2024)
di: Du, Zhuoyun, et al.
Pubblicazione: (2024)
GateLens: A Reasoning-Enhanced LLM Agent for Automotive Software Release Analytics
di: Khoee, Arsham Gholamzadeh, et al.
Pubblicazione: (2025)
di: Khoee, Arsham Gholamzadeh, et al.
Pubblicazione: (2025)
SAGE: Tool-Augmented LLM Task Solving Strategies in Scalable Multi-Agent Environments
di: Strehlow, Robert K., et al.
Pubblicazione: (2026)
di: Strehlow, Robert K., et al.
Pubblicazione: (2026)
Sketch2Simulation: Automating Flowsheet Generation via Multi Agent Large Language Models
di: Bahamdan, Abdullah, et al.
Pubblicazione: (2026)
di: Bahamdan, Abdullah, et al.
Pubblicazione: (2026)
Co-Saving: Resource Aware Multi-Agent Collaboration for Software Development
di: Qiu, Rennai, et al.
Pubblicazione: (2025)
di: Qiu, Rennai, et al.
Pubblicazione: (2025)
UCAgent: An End-to-End Agent for Block-Level Functional Verification
di: Wang, Junyue, et al.
Pubblicazione: (2026)
di: Wang, Junyue, et al.
Pubblicazione: (2026)
Agile V: A Compliance-Ready Framework for AI-Augmented Engineering -- From Concept to Audit-Ready Delivery
di: Koch, Christopher, et al.
Pubblicazione: (2026)
di: Koch, Christopher, et al.
Pubblicazione: (2026)
Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports
di: Gon, Mahmut Furkan, et al.
Pubblicazione: (2026)
di: Gon, Mahmut Furkan, et al.
Pubblicazione: (2026)
Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering
di: Salim, Mohamad, et al.
Pubblicazione: (2026)
di: Salim, Mohamad, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Governed Evolution of Agent Runtimes through Executable Operational Cognition
di: Garralda-Barrio, Mariano
Pubblicazione: (2026) -
From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work
di: Rosen, Josh, et al.
Pubblicazione: (2026) -
Exploring the Potential of Conversational Test Suite Based Program Repair on SWE-bench
di: Cheshkov, Anton, et al.
Pubblicazione: (2024) -
AgentGit: A Version Control Framework for Reliable and Scalable LLM-Powered Multi-Agent Systems
di: Li, Yang, et al.
Pubblicazione: (2025) -
El Agente Gráfico: Structured Execution Graphs for Scientific Agents
di: Bai, Jiaru, et al.
Pubblicazione: (2026)