MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Qinzhuo, Yang, Zhizhuo, Li, Hanhao, Gao, Pengzhi, Liu, Wei, Luan, Jian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
di: Liu, Guohong, et al.
Pubblicazione: (2026)
di: Liu, Guohong, et al.
Pubblicazione: (2026)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)
di: Deng, Shihan, et al.
Pubblicazione: (2024)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
di: Qu, Heng, et al.
Pubblicazione: (2026)
di: Qu, Heng, et al.
Pubblicazione: (2026)
Mobile GUI Agents under Real-world Threats: Are We There Yet?
di: Liu, Guohong, et al.
Pubblicazione: (2025)
di: Liu, Guohong, et al.
Pubblicazione: (2025)
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
di: Huang, Kun, et al.
Pubblicazione: (2025)
di: Huang, Kun, et al.
Pubblicazione: (2025)
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
di: Kong, Quyu, et al.
Pubblicazione: (2025)
di: Kong, Quyu, et al.
Pubblicazione: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
di: Gao, Longxi, et al.
Pubblicazione: (2024)
di: Gao, Longxi, et al.
Pubblicazione: (2024)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
di: Gao, Longxi, et al.
Pubblicazione: (2025)
di: Gao, Longxi, et al.
Pubblicazione: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
di: Sun, Liangtai, et al.
Pubblicazione: (2022)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
GUI-PRA: Process Reward Agent for GUI Tasks
di: Xiong, Tao, et al.
Pubblicazione: (2025)
di: Xiong, Tao, et al.
Pubblicazione: (2025)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
di: Lee, Juyong, et al.
Pubblicazione: (2024)
di: Lee, Juyong, et al.
Pubblicazione: (2024)
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
di: Hu, Xiaomeng, et al.
Pubblicazione: (2026)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2026)
Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical Study
di: Cui, Menglong, et al.
Pubblicazione: (2025)
di: Cui, Menglong, et al.
Pubblicazione: (2025)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
di: Shang, Yuzhe, et al.
Pubblicazione: (2026)
di: Shang, Yuzhe, et al.
Pubblicazione: (2026)
Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2025)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
di: Xu, Haiyang, et al.
Pubblicazione: (2026)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
di: Wang, Junyang, et al.
Pubblicazione: (2026)
di: Wang, Junyang, et al.
Pubblicazione: (2026)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
di: Lu, Xudong, et al.
Pubblicazione: (2026)
di: Lu, Xudong, et al.
Pubblicazione: (2026)
CoME: Empowering Channel-of-Mobile-Experts with Informative Hybrid-Capabilities Reasoning
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases
di: Xue, Xiaona, et al.
Pubblicazione: (2026)
di: Xue, Xiaona, et al.
Pubblicazione: (2026)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
di: Im, Youngmin, et al.
Pubblicazione: (2025)
di: Im, Youngmin, et al.
Pubblicazione: (2025)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translation
di: Shang, Yuzhe, et al.
Pubblicazione: (2026)
di: Shang, Yuzhe, et al.
Pubblicazione: (2026)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
di: Nie, Ying, et al.
Pubblicazione: (2024)
di: Nie, Ying, et al.
Pubblicazione: (2024)
FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain
di: Zeng, Lingfeng, et al.
Pubblicazione: (2025)
di: Zeng, Lingfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025) -
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025) -
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025) -
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
di: Liu, Guohong, et al.
Pubblicazione: (2026) -
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)