MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Fei, Yang, Yibo, Sun, Wenxiu, Lin, Dahua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025)
par: Li, Renhao, et autres
Publié: (2025)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026)
par: Yang, Jie, et autres
Publié: (2026)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
par: Yao, Shunyu, et autres
Publié: (2024)
par: Yao, Shunyu, et autres
Publié: (2024)
Benchmarking LLM Tool-Use in the Wild
par: Yu, Peijie, et autres
Publié: (2026)
par: Yu, Peijie, et autres
Publié: (2026)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
par: Bian, Haonan, et autres
Publié: (2026)
par: Bian, Haonan, et autres
Publié: (2026)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
par: Xiao, Zikai, et autres
Publié: (2025)
par: Xiao, Zikai, et autres
Publié: (2025)
TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
par: Zong, Xuanjun, et autres
Publié: (2025)
par: Zong, Xuanjun, et autres
Publié: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
par: Jiang, Dongfu, et autres
Publié: (2025)
par: Jiang, Dongfu, et autres
Publié: (2025)
SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
par: Jeon, Changhyun, et autres
Publié: (2025)
par: Jeon, Changhyun, et autres
Publié: (2025)
REALM: A Dataset of Real-World LLM Use Cases
par: Cheng, Jingwen, et autres
Publié: (2025)
par: Cheng, Jingwen, et autres
Publié: (2025)
CCTU: A Benchmark for Tool Use under Complex Constraints
par: Ye, Junjie, et autres
Publié: (2026)
par: Ye, Junjie, et autres
Publié: (2026)
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
par: Chen, Sen, et autres
Publié: (2025)
par: Chen, Sen, et autres
Publié: (2025)
StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIs
par: Guo, Zhicheng, et autres
Publié: (2025)
par: Guo, Zhicheng, et autres
Publié: (2025)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
par: Ma, Yichuan, et autres
Publié: (2026)
par: Ma, Yichuan, et autres
Publié: (2026)
DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios
par: Wu, Junchao, et autres
Publié: (2024)
par: Wu, Junchao, et autres
Publié: (2024)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
par: Wang, Jize, et autres
Publié: (2026)
par: Wang, Jize, et autres
Publié: (2026)
Agentic Reinforcement Learning for Real-World Code Repair
par: Zhu, Siyu, et autres
Publié: (2025)
par: Zhu, Siyu, et autres
Publié: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
par: Wu, Junde, et autres
Publié: (2025)
par: Wu, Junde, et autres
Publié: (2025)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
par: Zhang, Yinger, et autres
Publié: (2026)
par: Zhang, Yinger, et autres
Publié: (2026)
Flames: Benchmarking Value Alignment of LLMs in Chinese
par: Huang, Kexin, et autres
Publié: (2023)
par: Huang, Kexin, et autres
Publié: (2023)
Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization
par: Chi, Yizhe, et autres
Publié: (2026)
par: Chi, Yizhe, et autres
Publié: (2026)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
par: Zhou, Ruiwen, et autres
Publié: (2024)
par: Zhou, Ruiwen, et autres
Publié: (2024)
Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems
par: Shukla, Manish
Publié: (2025)
par: Shukla, Manish
Publié: (2025)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
par: Qi, Yunjia, et autres
Publié: (2025)
par: Qi, Yunjia, et autres
Publié: (2025)
ToolBeHonest: A Multi-level Hallucination Diagnostic Benchmark for Tool-Augmented Large Language Models
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Balanced Data Sampling for Language Model Training with Clustering
par: Shao, Yunfan, et autres
Publié: (2024)
par: Shao, Yunfan, et autres
Publié: (2024)
Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
par: Li, Zhuofeng, et autres
Publié: (2025)
par: Li, Zhuofeng, et autres
Publié: (2025)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Consultant Decoding: Yet Another Synergistic Mechanism
par: Ding, Chuanghao, et autres
Publié: (2025)
par: Ding, Chuanghao, et autres
Publié: (2025)
CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
par: Ismayilzada, Mete, et autres
Publié: (2026)
par: Ismayilzada, Mete, et autres
Publié: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
par: Lu, Jiarui, et autres
Publié: (2024)
par: Lu, Jiarui, et autres
Publié: (2024)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
par: Wu, Qinzhuo, et autres
Publié: (2026)
par: Wu, Qinzhuo, et autres
Publié: (2026)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
par: Zhang, Xiaoyi, et autres
Publié: (2025)
par: Zhang, Xiaoyi, et autres
Publié: (2025)
Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools
par: Hao, Yilun, et autres
Publié: (2024)
par: Hao, Yilun, et autres
Publié: (2024)
Documents similaires
-
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025) -
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
par: Yang, Jie, et autres
Publié: (2026) -
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
par: Zhu, Jie, et autres
Publié: (2026) -
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025) -
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
par: Yao, Shunyu, et autres
Publié: (2024)