Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Shihan, Xu, Weikai, Sun, Hongda, Liu, Wei, Tan, Tao, Liu, Jianfeng, Li, Ang, Luan, Jian, Wang, Bin, Yan, Rui, Shang, Shuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025)
di: Xu, Weikai, et al.
Pubblicazione: (2025)
DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to Determinacy
di: Sun, Hongda, et al.
Pubblicazione: (2023)
di: Sun, Hongda, et al.
Pubblicazione: (2023)
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
di: Liu, Yuxuan, et al.
Pubblicazione: (2025)
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
di: Huang, Kun, et al.
Pubblicazione: (2025)
di: Huang, Kun, et al.
Pubblicazione: (2025)
MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents
di: Wang, Luyuan, et al.
Pubblicazione: (2024)
di: Wang, Luyuan, et al.
Pubblicazione: (2024)
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
di: Wu, Qinzhuo, et al.
Pubblicazione: (2025)
CoME: Empowering Channel-of-Mobile-Experts with Informative Hybrid-Capabilities Reasoning
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation
di: Qu, Heng, et al.
Pubblicazione: (2026)
di: Qu, Heng, et al.
Pubblicazione: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
di: Song, Zhiheng, et al.
Pubblicazione: (2026)
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
di: Liu, Guohong, et al.
Pubblicazione: (2026)
di: Liu, Guohong, et al.
Pubblicazione: (2026)
MobileFlow: A Multimodal LLM For Mobile GUI Agent
di: Nong, Songqin, et al.
Pubblicazione: (2024)
di: Nong, Songqin, et al.
Pubblicazione: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
di: Jiang, Zhizheng, et al.
Pubblicazione: (2026)
di: Jiang, Zhizheng, et al.
Pubblicazione: (2026)
PMSS: Pretrained Matrices Skeleton Selection for LLM Fine-tuning
di: Wang, Qibin, et al.
Pubblicazione: (2024)
di: Wang, Qibin, et al.
Pubblicazione: (2024)
AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
di: Sun, Jiazheng, et al.
Pubblicazione: (2026)
Mobile GUI Agents under Real-world Threats: Are We There Yet?
di: Liu, Guohong, et al.
Pubblicazione: (2025)
di: Liu, Guohong, et al.
Pubblicazione: (2025)
MemGUI-Bench: Benchmarking Memory of Mobile GUI Agents in Dynamic Environments
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
di: Liu, Guangyi, et al.
Pubblicazione: (2026)
KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation
di: Chen, Tongbo, et al.
Pubblicazione: (2026)
di: Chen, Tongbo, et al.
Pubblicazione: (2026)
AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control
di: Lee, Juyong, et al.
Pubblicazione: (2024)
di: Lee, Juyong, et al.
Pubblicazione: (2024)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
More is not always better? Enhancing Many-Shot In-Context Learning with Differentiated and Reweighting Objectives
di: Zhang, Xiaoqing, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoqing, et al.
Pubblicazione: (2025)
VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics
di: Gong, Yichen, et al.
Pubblicazione: (2026)
di: Gong, Yichen, et al.
Pubblicazione: (2026)
MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
di: Im, Youngmin, et al.
Pubblicazione: (2025)
di: Im, Youngmin, et al.
Pubblicazione: (2025)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks
di: Weng, Muyan, et al.
Pubblicazione: (2026)
di: Weng, Muyan, et al.
Pubblicazione: (2026)
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents
di: Li, Chao, et al.
Pubblicazione: (2026)
di: Li, Chao, et al.
Pubblicazione: (2026)
MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments
di: Yu, Yi, et al.
Pubblicazione: (2026)
di: Yu, Yi, et al.
Pubblicazione: (2026)
MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
di: Fakorede, Moshood A., et al.
Pubblicazione: (2026)
di: Fakorede, Moshood A., et al.
Pubblicazione: (2026)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
di: Kong, Quyu, et al.
Pubblicazione: (2025)
di: Kong, Quyu, et al.
Pubblicazione: (2025)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
di: Gao, Longxi, et al.
Pubblicazione: (2024)
di: Gao, Longxi, et al.
Pubblicazione: (2024)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
Guiding LLM-Based Human Mobility Simulation with Mobility Measures from Shared Data
di: Yan, Hua, et al.
Pubblicazione: (2026)
di: Yan, Hua, et al.
Pubblicazione: (2026)
Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction
di: Zhang, Danyang, et al.
Pubblicazione: (2023)
di: Zhang, Danyang, et al.
Pubblicazione: (2023)
Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation
di: Yan, Hua, et al.
Pubblicazione: (2026)
di: Yan, Hua, et al.
Pubblicazione: (2026)
FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
di: Zhu, Hongda, et al.
Pubblicazione: (2025)
di: Zhu, Hongda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
di: Wu, Qinzhuo, et al.
Pubblicazione: (2024) -
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
di: Xu, Weikai, et al.
Pubblicazione: (2025) -
DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to Determinacy
di: Sun, Hongda, et al.
Pubblicazione: (2023) -
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
di: Liu, Yuxuan, et al.
Pubblicazione: (2025) -
MobileBench-OL: A Comprehensive Chinese Benchmark for Evaluating Mobile GUI Agents in Real-World Environment
di: Wu, Qinzhuo, et al.
Pubblicazione: (2026)