OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Hongrui, Liao, Jitong, Zhang, Xi, Xu, Haiyang, Xie, Tianbao, Jiang, Chaoya, Yan, Ming, Liu, Si, Ye, Wei, Huang, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
par: Abhyankar, Reyna, et autres
Publié: (2025)
par: Abhyankar, Reyna, et autres
Publié: (2025)
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
par: Bandi, Chaithanya, et autres
Publié: (2026)
par: Bandi, Chaithanya, et autres
Publié: (2026)
LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS
par: Mei, Kai, et autres
Publié: (2025)
par: Mei, Kai, et autres
Publié: (2025)
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
par: Yang, Jingyi, et autres
Publié: (2025)
par: Yang, Jingyi, et autres
Publié: (2025)
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
par: Wang, Wenhao, et autres
Publié: (2025)
par: Wang, Wenhao, et autres
Publié: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
par: Wang, Zhenting, et autres
Publié: (2025)
par: Wang, Zhenting, et autres
Publié: (2025)
MCP-Zero: Active Tool Discovery for Autonomous LLM Agents
par: Fei, Xiang, et autres
Publié: (2025)
par: Fei, Xiang, et autres
Publié: (2025)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
par: Guo, Zikang, et autres
Publié: (2025)
par: Guo, Zikang, et autres
Publié: (2025)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
par: Jia, Hongrui, et autres
Publié: (2024)
par: Jia, Hongrui, et autres
Publié: (2024)
ParaView-MCP: An Autonomous Visualization Agent with Direct Tool Use
par: Liu, Shusen, et autres
Publié: (2025)
par: Liu, Shusen, et autres
Publié: (2025)
ETOM: A Five-Level Benchmark for Evaluating Tool Orchestration within the MCP Ecosystem
par: Dong, Jia-Kai, et autres
Publié: (2025)
par: Dong, Jia-Kai, et autres
Publié: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
par: Jia, Hongrui, et autres
Publié: (2025)
par: Jia, Hongrui, et autres
Publié: (2025)
MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP
par: Li, Ruiqi, et autres
Publié: (2026)
par: Li, Ruiqi, et autres
Publié: (2026)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
par: Liu, Wenrui, et autres
Publié: (2025)
par: Liu, Wenrui, et autres
Publié: (2025)
MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
par: Gao, Xuanqi, et autres
Publié: (2025)
par: Gao, Xuanqi, et autres
Publié: (2025)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions
par: Hasan, Mohammed Mehedi, et autres
Publié: (2026)
par: Hasan, Mohammed Mehedi, et autres
Publié: (2026)
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
par: Zhu, Yakun, et autres
Publié: (2026)
par: Zhu, Yakun, et autres
Publié: (2026)
MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
par: Fan, Shiqing, et autres
Publié: (2025)
par: Fan, Shiqing, et autres
Publié: (2025)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
par: Hu, Xuhao, et autres
Publié: (2026)
par: Hu, Xuhao, et autres
Publié: (2026)
Advancing and Benchmarking Personalized Tool Invocation for LLMs
par: Huang, Xu, et autres
Publié: (2025)
par: Huang, Xu, et autres
Publié: (2025)
LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
par: Yin, Ming, et autres
Publié: (2025)
par: Yin, Ming, et autres
Publié: (2025)
Auditing MCP Servers for Over-Privileged Tool Capabilities
par: Huang, Charoes, et autres
Publié: (2026)
par: Huang, Charoes, et autres
Publié: (2026)
MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools
par: Tan, Zhuoran, et autres
Publié: (2026)
par: Tan, Zhuoran, et autres
Publié: (2026)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
Human Tool: An MCP-Style Framework for Human-Agent Collaboration
par: Tang, Yuanrong, et autres
Publié: (2026)
par: Tang, Yuanrong, et autres
Publié: (2026)
LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?
par: Mo, Guozhao, et autres
Publié: (2025)
par: Mo, Guozhao, et autres
Publié: (2025)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
par: Jia, Hongrui, et autres
Publié: (2026)
par: Jia, Hongrui, et autres
Publié: (2026)
HumanMCP: A Human-Like Query Dataset for Evaluating MCP Tool Retrieval Performance
par: Laddha, Shubh, et autres
Publié: (2025)
par: Laddha, Shubh, et autres
Publié: (2025)
EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
par: He, Tiantian, et autres
Publié: (2026)
par: He, Tiantian, et autres
Publié: (2026)
MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments
par: Ganapavarapu, Giridhar, et autres
Publié: (2026)
par: Ganapavarapu, Giridhar, et autres
Publié: (2026)
Overthinking Loops in Agents: A Structural Risk via MCP Tools
par: Lee, Yohan, et autres
Publié: (2026)
par: Lee, Yohan, et autres
Publié: (2026)
MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers
par: Wang, Zhiqiang, et autres
Publié: (2025)
par: Wang, Zhiqiang, et autres
Publié: (2025)
macOSWorld: A Multilingual Interactive Benchmark for GUI Agents
par: Yang, Pei, et autres
Publié: (2025)
par: Yang, Pei, et autres
Publié: (2025)
MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks
par: Hao, Run, et autres
Publié: (2026)
par: Hao, Run, et autres
Publié: (2026)
Busemann and MCP
par: Fujioka, Tadashi, et autres
Publié: (2026)
par: Fujioka, Tadashi, et autres
Publié: (2026)
Code2MCP: Transforming Code Repositories into MCP Services
par: Ouyang, Chaoqian, et autres
Publié: (2025)
par: Ouyang, Chaoqian, et autres
Publié: (2025)
Documents similaires
-
OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
par: Abhyankar, Reyna, et autres
Publié: (2025) -
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
par: Bandi, Chaithanya, et autres
Publié: (2026) -
LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS
par: Mei, Kai, et autres
Publié: (2025) -
RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents
par: Yang, Jingyi, et autres
Publié: (2025) -
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
par: Wang, Wenhao, et autres
Publié: (2025)