MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Yan, Yunhe, Wang, Shihe, Du, Jiajun, Yang, Yexuan, Shan, Yuxuan, Qiu, Qichen, Jia, Xianqing, Wang, Xinge, Yuan, Xin, Han, Xu, Qin, Mao, Chen, Yinxiao, Peng, Chen, Wang, Shangguang, Xu, Mengwei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LlamaTouch: A Faithful and Scalable Testbed for Mobile UI Task Automation
by: Zhang, Li, et al.
Published: (2024)
by: Zhang, Li, et al.
Published: (2024)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
by: Gao, Longxi, et al.
Published: (2024)
by: Gao, Longxi, et al.
Published: (2024)
Mobile Foundation Model as Firmware
by: Yuan, Jinliang, et al.
Published: (2023)
by: Yuan, Jinliang, et al.
Published: (2023)
Recall: Empowering Multimodal Embedding for Edge Devices
by: Cai, Dongqi, et al.
Published: (2024)
by: Cai, Dongqi, et al.
Published: (2024)
FwdLLM: Efficient FedLLM using Forward Gradient
by: Xu, Mengwei, et al.
Published: (2023)
by: Xu, Mengwei, et al.
Published: (2023)
FedMoE: Personalized Federated Learning via Heterogeneous Mixture of Experts
by: Mei, Hanzi, et al.
Published: (2024)
by: Mei, Hanzi, et al.
Published: (2024)
DroidCall: A Dataset for LLM-powered Android Intent Invocation
by: Xie, Weikai, et al.
Published: (2024)
by: Xie, Weikai, et al.
Published: (2024)
LoRASuite: Efficient LoRA Adaptation Across Large Language Model Upgrades
by: Li, Yanan, et al.
Published: (2025)
by: Li, Yanan, et al.
Published: (2025)
EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices
by: Yi, Rongjie, et al.
Published: (2023)
by: Yi, Rongjie, et al.
Published: (2023)
FedRDMA: Communication-Efficient Cross-Silo Federated LLM via Chunked RDMA Transmission
by: Zhang, Zeling, et al.
Published: (2024)
by: Zhang, Zeling, et al.
Published: (2024)
Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
by: Chen, Zhiyang, et al.
Published: (2025)
by: Chen, Zhiyang, et al.
Published: (2025)
Does Chain-of-Thought Reasoning Help Mobile GUI Agent? An Empirical Study
by: Zhang, Li, et al.
Published: (2025)
by: Zhang, Li, et al.
Published: (2025)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
by: Zhao, Pengxiang, et al.
Published: (2025)
by: Zhao, Pengxiang, et al.
Published: (2025)
Accelerating Vertical Federated Learning
by: Cai, Dongqi, et al.
Published: (2022)
by: Cai, Dongqi, et al.
Published: (2022)
Deciphering the Enigma of Satellite Computing with COTS Devices: Measurement and Analysis
by: Xing, Ruolin, et al.
Published: (2024)
by: Xing, Ruolin, et al.
Published: (2024)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
by: Gao, Longxi, et al.
Published: (2025)
by: Gao, Longxi, et al.
Published: (2025)
MobiEdit: Resource-efficient Knowledge Editing for Personalized On-device LLMs
by: Lu, Zhenyan, et al.
Published: (2025)
by: Lu, Zhenyan, et al.
Published: (2025)
ShortcutsBench: A Large-Scale Real-world Benchmark for API-based Agents
by: Shen, Haiyang, et al.
Published: (2024)
by: Shen, Haiyang, et al.
Published: (2024)
Information Encryption for Digital Libraries Using a Cloud–Fog Hybrid SD‐CFIIoT Architecture
by: Xue Teng, et al.
Published: (2025)
by: Xue Teng, et al.
Published: (2025)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
by: Sun, Yuchen, et al.
Published: (2025)
by: Sun, Yuchen, et al.
Published: (2025)
A posteriori error bounds for the block-Lanczos method for matrix function approximation
by: Xu, Qichen, et al.
Published: (2022)
by: Xu, Qichen, et al.
Published: (2022)
Engineered CeO2@Ru Nanospheres via Size‐Metal‐Loading Synergy to Enhance Chemiluminescence Efficiency for Sensitive Immunochromatographic Assay
by: Changwei Luo, et al.
Published: (2025)
by: Changwei Luo, et al.
Published: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
by: Zhao, Kangjia, et al.
Published: (2024)
by: Zhao, Kangjia, et al.
Published: (2024)
Sea Surface Temperature Simulation of Tropical and North Pacific Basins Using a Hybrid Coordinate Ocean Model (HYCOM).
by: Gao, Song, et al.
Published: (2008)
by: Gao, Song, et al.
Published: (2008)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
by: Chen, Ruihan, et al.
Published: (2025)
by: Chen, Ruihan, et al.
Published: (2025)
Macroporous Zwitterionic Hydrogel Sponge With Enhanced Kinetics by In‐Situ UV Cryogelation for Efficient Water Production
by: Xinge Yang, et al.
Published: (2026)
by: Xinge Yang, et al.
Published: (2026)
Beyond Isolation: A Unified Benchmark for General-Purpose Navigation
by: Sun, Samson, et al.
Published: (2026)
by: Sun, Samson, et al.
Published: (2026)
LearnAct: Few-Shot Mobile GUI Agent with a Unified Demonstration Benchmark
by: Liu, Guangyi, et al.
Published: (2025)
by: Liu, Guangyi, et al.
Published: (2025)
A Survey of Resource-efficient LLM and Multimodal Foundation Models
by: Xu, Mengwei, et al.
Published: (2024)
by: Xu, Mengwei, et al.
Published: (2024)
Towards Parameterized Hardness on Maintaining Conjunctive Queries
by: Wang, Qichen
Published: (2026)
by: Wang, Qichen
Published: (2026)
PhoneLM:an Efficient and Capable Small Language Model Family through Principled Pre-training
by: Yi, Rongjie, et al.
Published: (2024)
by: Yi, Rongjie, et al.
Published: (2024)
Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction
by: Xu, Yiheng, et al.
Published: (2024)
by: Xu, Yiheng, et al.
Published: (2024)
Supplementary Material for Pharmacodynamic Modeling of Cinacalcet in Secondary Hyperparathyroidism Efficacy and Influencing Factors Analysis
by: Yexuan, Wangyexuan
Published: (2025)
by: Yexuan, Wangyexuan
Published: (2025)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
by: Wang, Ziwei, et al.
Published: (2025)
by: Wang, Ziwei, et al.
Published: (2025)
FedGUI: Benchmarking Federated GUI Agents across Heterogeneous Platforms, Devices, and Operating Systems
by: Wang, Wenhao, et al.
Published: (2026)
by: Wang, Wenhao, et al.
Published: (2026)
Every Software as an Agent: Blueprint and Case Study
by: Xu, Mengwei
Published: (2025)
by: Xu, Mengwei
Published: (2025)
API Agents vs. GUI Agents: Divergence and Convergence
by: Zhang, Chaoyun, et al.
Published: (2025)
by: Zhang, Chaoyun, et al.
Published: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
by: Li, Yang, et al.
Published: (2026)
by: Li, Yang, et al.
Published: (2026)
Computer simulation‐guided template selection for a molecularly imprinted polymer for selective trifluralin adsorption
by: Lianjun Song, et al.
Published: (2024)
by: Lianjun Song, et al.
Published: (2024)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
by: Li, Hongxin, et al.
Published: (2026)
by: Li, Hongxin, et al.
Published: (2026)
Similar Items
-
LlamaTouch: A Faithful and Scalable Testbed for Mobile UI Task Automation
by: Zhang, Li, et al.
Published: (2024) -
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
by: Gao, Longxi, et al.
Published: (2024) -
Mobile Foundation Model as Firmware
by: Yuan, Jinliang, et al.
Published: (2023) -
Recall: Empowering Multimodal Embedding for Edge Devices
by: Cai, Dongqi, et al.
Published: (2024) -
FwdLLM: Efficient FedLLM using Forward Gradient
by: Xu, Mengwei, et al.
Published: (2023)