MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenhao, Niu, Peizhi, Zou, Gongyi, Yang, Xiyuan, Wang, Jingxing, Shi, Haoting, Du, Yaxin, Chai, Jingyi, Pang, Xianghe, Tang, Shuo, Wang, Yanfeng, Chen, Siheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
di: Du, Yaxin, et al.
Pubblicazione: (2025)
di: Du, Yaxin, et al.
Pubblicazione: (2025)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
di: Pang, Xianghe, et al.
Pubblicazione: (2024)
di: Pang, Xianghe, et al.
Pubblicazione: (2024)
KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from Server
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
di: Wang, Wenhao, et al.
Pubblicazione: (2024)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
di: Pang, Xianghe, et al.
Pubblicazione: (2025)
di: Pang, Xianghe, et al.
Pubblicazione: (2025)
OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
Malicious Agent Detection for Robust Multi-Agent Collaborative Perception
di: Zhao, Yangheng, et al.
Pubblicazione: (2023)
di: Zhao, Yangheng, et al.
Pubblicazione: (2023)
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization
di: Chen, Menglan, et al.
Pubblicazione: (2025)
di: Chen, Menglan, et al.
Pubblicazione: (2025)
Incentivizing Inclusive Contributions in Model Sharing Markets
di: Zhang, Enpei, et al.
Pubblicazione: (2025)
di: Zhang, Enpei, et al.
Pubblicazione: (2025)
FedMABench: Benchmarking Mobile Agents on Decentralized Heterogeneous User Data
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
Leveraging Unstructured Text Data for Federated Instruction Tuning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
di: Wang, Zhiqiang, et al.
Pubblicazione: (2025)
Graph Transductive Defense: a Two-Stage Defense for Graph Membership Inference Attacks
di: Niu, Peizhi, et al.
Pubblicazione: (2024)
di: Niu, Peizhi, et al.
Pubblicazione: (2024)
Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
Enhancing Data Quality in Federated Fine-Tuning of Foundation Models
di: Zhao, Wanru, et al.
Pubblicazione: (2024)
di: Zhao, Wanru, et al.
Pubblicazione: (2024)
SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
di: Du, Yaxin, et al.
Pubblicazione: (2025)
di: Du, Yaxin, et al.
Pubblicazione: (2025)
MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
di: Wang, Zhenting, et al.
Pubblicazione: (2025)
FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems
di: Wang, Wenhao, et al.
Pubblicazione: (2026)
di: Wang, Wenhao, et al.
Pubblicazione: (2026)
SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents
di: Yin, Sheng, et al.
Pubblicazione: (2024)
di: Yin, Sheng, et al.
Pubblicazione: (2024)
Towards Self-Evolving Agentic Literature Retrieval
di: Du, Yuwen, et al.
Pubblicazione: (2026)
di: Du, Yuwen, et al.
Pubblicazione: (2026)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
di: Guo, Zikang, et al.
Pubblicazione: (2025)
di: Guo, Zikang, et al.
Pubblicazione: (2025)
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
di: Kong, Quyu, et al.
Pubblicazione: (2025)
di: Kong, Quyu, et al.
Pubblicazione: (2025)
Data Quality Control in Federated Instruction-tuning of Large Language Models
di: Du, Yaxin, et al.
Pubblicazione: (2024)
di: Du, Yaxin, et al.
Pubblicazione: (2024)
SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?
di: Chai, Jingyi, et al.
Pubblicazione: (2025)
di: Chai, Jingyi, et al.
Pubblicazione: (2025)
EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
FedRSU: Federated Learning for Scene Flow Estimation on Roadside Units
di: Fang, Shaoheng, et al.
Pubblicazione: (2024)
di: Fang, Shaoheng, et al.
Pubblicazione: (2024)
MCP-Cosmos: World Model-Augmented Agents for Complex Task Execution in MCP Environments
di: Ganapavarapu, Giridhar, et al.
Pubblicazione: (2026)
di: Ganapavarapu, Giridhar, et al.
Pubblicazione: (2026)
Decentralized and Lifelong-Adaptive Multi-Agent Collaborative Learning
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
Text2Mem: A Unified Memory Operation Language for Memory Operating System
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Data-Efficient Learning of Anomalous Diffusion with Wavelet Representations: Enabling Direct Learning from Experimental Trajectories
di: Wang, Gongyi, et al.
Pubblicazione: (2025)
di: Wang, Gongyi, et al.
Pubblicazione: (2025)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
di: Wang, Xuan, et al.
Pubblicazione: (2023)
di: Wang, Xuan, et al.
Pubblicazione: (2023)
TripTailor: A Real-World Benchmark for Personalized Travel Planning
di: Shen, Yuanzhe, et al.
Pubblicazione: (2025)
di: Shen, Yuanzhe, et al.
Pubblicazione: (2025)
EMMOE: A Comprehensive Benchmark for Embodied Mobile Manipulation in Open Environments
di: Li, Dongping, et al.
Pubblicazione: (2025)
di: Li, Dongping, et al.
Pubblicazione: (2025)
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
di: Luo, Ziyang, et al.
Pubblicazione: (2025)
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
di: Bandi, Chaithanya, et al.
Pubblicazione: (2026)
di: Bandi, Chaithanya, et al.
Pubblicazione: (2026)
X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs
di: Ye, Rui, et al.
Pubblicazione: (2025)
di: Ye, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
di: Wang, Wenhao, et al.
Pubblicazione: (2025) -
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
di: Du, Yaxin, et al.
Pubblicazione: (2025) -
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
di: Pang, Xianghe, et al.
Pubblicazione: (2024) -
KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from Server
di: Wang, Wenhao, et al.
Pubblicazione: (2024) -
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)