LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Ming, Shen, Dinghan, Xu, Silei, Dong, Sixun, Zhang, Mian, Hu, Yebowen, Liu, Shujian, Han, Jianbing, Ma, Simin, Wang, Song, Indurthi, Sathish Reddy, Wang, Xun, Chen, Yiran, Song, Kaiqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TCIA: A Task-Centric Instruction Augmentation Method for Instruction Finetuning
di: Ma, Simin, et al.
Pubblicazione: (2025)
di: Ma, Simin, et al.
Pubblicazione: (2025)
Complex Logical Instruction Generation
di: Zhang, Mian, et al.
Pubblicazione: (2025)
di: Zhang, Mian, et al.
Pubblicazione: (2025)
Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model
di: Faisal, Fahim, et al.
Pubblicazione: (2025)
di: Faisal, Fahim, et al.
Pubblicazione: (2025)
Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication
di: Lu, Yiming, et al.
Pubblicazione: (2025)
di: Lu, Yiming, et al.
Pubblicazione: (2025)
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
di: Wu, Tong, et al.
Pubblicazione: (2024)
di: Wu, Tong, et al.
Pubblicazione: (2024)
Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment
di: Gulhane, Radha, et al.
Pubblicazione: (2025)
di: Gulhane, Radha, et al.
Pubblicazione: (2025)
Optimizing FaaS Platforms for MCP-enabled Agentic Workflows
di: Kulkarni, Varad, et al.
Pubblicazione: (2026)
di: Kulkarni, Varad, et al.
Pubblicazione: (2026)
Improving Multilingual Instruction Finetuning via Linguistically Natural and Diverse Datasets
di: Indurthi, Sathish Reddy, et al.
Pubblicazione: (2024)
di: Indurthi, Sathish Reddy, et al.
Pubblicazione: (2024)
HumanMCP: A Human-Like Query Dataset for Evaluating MCP Tool Retrieval Performance
di: Laddha, Shubh, et al.
Pubblicazione: (2025)
di: Laddha, Shubh, et al.
Pubblicazione: (2025)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP
di: Li, Ruiqi, et al.
Pubblicazione: (2026)
di: Li, Ruiqi, et al.
Pubblicazione: (2026)
Construction of type II blow-up solutions for the energy-critical wave equation with an inverse-square potential in dimension 3
di: Wang, Dinghan
Pubblicazione: (2024)
di: Wang, Dinghan
Pubblicazione: (2024)
Busemann and MCP
di: Fujioka, Tadashi, et al.
Pubblicazione: (2026)
di: Fujioka, Tadashi, et al.
Pubblicazione: (2026)
Code2MCP: Transforming Code Repositories into MCP Services
di: Ouyang, Chaoqian, et al.
Pubblicazione: (2025)
di: Ouyang, Chaoqian, et al.
Pubblicazione: (2025)
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
MCP-in-SoS: Risk assessment framework for open-source MCP servers
di: Kumar, Pratyay, et al.
Pubblicazione: (2026)
di: Kumar, Pratyay, et al.
Pubblicazione: (2026)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
di: Jia, Hongrui, et al.
Pubblicazione: (2025)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
di: Guo, Zikang, et al.
Pubblicazione: (2025)
di: Guo, Zikang, et al.
Pubblicazione: (2025)
LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?
di: Mo, Guozhao, et al.
Pubblicazione: (2025)
di: Mo, Guozhao, et al.
Pubblicazione: (2025)
Human Tool: An MCP-Style Framework for Human-Agent Collaboration
di: Tang, Yuanrong, et al.
Pubblicazione: (2026)
di: Tang, Yuanrong, et al.
Pubblicazione: (2026)
DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers
di: Pujara, Aditya, et al.
Pubblicazione: (2026)
di: Pujara, Aditya, et al.
Pubblicazione: (2026)
BioinfoMCP: A Unified Platform Enabling MCP Interfaces in Agentic Bioinformatics
di: Widjaja, Florensia, et al.
Pubblicazione: (2025)
di: Widjaja, Florensia, et al.
Pubblicazione: (2025)
EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
di: He, Tiantian, et al.
Pubblicazione: (2026)
di: He, Tiantian, et al.
Pubblicazione: (2026)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
MCP Guardian: A Security-First Layer for Safeguarding MCP-Based AI Systems
di: Anubhav, Girdhar
Pubblicazione: (2025)
di: Anubhav, Girdhar
Pubblicazione: (2025)
TrialMCP Pack: MCP Servers for Physical AI Oncology Clinical Trial Systems
di: Kevin Kawchak, et al.
Pubblicazione: (2026)
di: Kevin Kawchak, et al.
Pubblicazione: (2026)
MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools
di: Tan, Zhuoran, et al.
Pubblicazione: (2026)
di: Tan, Zhuoran, et al.
Pubblicazione: (2026)
MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments
di: Ganapavarapu, Giridhar, et al.
Pubblicazione: (2026)
di: Ganapavarapu, Giridhar, et al.
Pubblicazione: (2026)
MCP Guardian: A Security-First Layer for Safeguarding MCP-Based AI System
di: Kumar, Sonu, et al.
Pubblicazione: (2025)
di: Kumar, Sonu, et al.
Pubblicazione: (2025)
Model Context Protocol (MCP) at First Glance: Studying the Security and Maintainability of MCP Servers
di: Hasan, Mohammed Mehedi, et al.
Pubblicazione: (2025)
di: Hasan, Mohammed Mehedi, et al.
Pubblicazione: (2025)
AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
Evaluation Report on MCP Servers
di: Luo, Zhiling, et al.
Pubblicazione: (2025)
di: Luo, Zhiling, et al.
Pubblicazione: (2025)
Learning Graph Laplacian with MCP
di: Zhang, Yangjing, et al.
Pubblicazione: (2020)
di: Zhang, Yangjing, et al.
Pubblicazione: (2020)
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
di: Bandi, Chaithanya, et al.
Pubblicazione: (2026)
di: Bandi, Chaithanya, et al.
Pubblicazione: (2026)
We Urgently Need Privilege Management in MCP: A Measurement of API Usage in MCP Ecosystems
di: Li, Zhihao, et al.
Pubblicazione: (2025)
di: Li, Zhihao, et al.
Pubblicazione: (2025)
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
di: Zhu, Yakun, et al.
Pubblicazione: (2026)
di: Zhu, Yakun, et al.
Pubblicazione: (2026)
SportsMetrics: Blending Text and Numerical Data to Understand Information Fusion in LLMs
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TCIA: A Task-Centric Instruction Augmentation Method for Instruction Finetuning
di: Ma, Simin, et al.
Pubblicazione: (2025) -
Complex Logical Instruction Generation
di: Zhang, Mian, et al.
Pubblicazione: (2025) -
Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model
di: Faisal, Fahim, et al.
Pubblicazione: (2025) -
Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication
di: Lu, Yiming, et al.
Pubblicazione: (2025) -
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)