SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Jingxuan, Yuen, Derek, Xie, Bin, Yang, Yuhao, Chen, Gongwei, Wu, Zhihao, Yixing, Li, Zhou, Xurui, Liu, Weiwen, Wang, Shuai, Zhou, Kaiwen, Shao, Rui, Nie, Liqiang, Wang, Yasheng, Hao, Jianye, Wang, Jun, Shao, Kun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Less is More: Empowering GUI Agent with Context-Aware Simplification
by: Chen, Gongwei, et al.
Published: (2025)
by: Chen, Gongwei, et al.
Published: (2025)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
by: Zhou, Xurui, et al.
Published: (2025)
by: Zhou, Xurui, et al.
Published: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
by: Shao, Rui, et al.
Published: (2026)
by: Shao, Rui, et al.
Published: (2026)
GUI Agents with Foundation Models: A Comprehensive Survey
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
by: Zhang, Renshan, et al.
Published: (2025)
by: Zhang, Renshan, et al.
Published: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
by: Xie, Bin, et al.
Published: (2025)
by: Xie, Bin, et al.
Published: (2025)
Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills
by: Xie, Yuquan, et al.
Published: (2025)
by: Xie, Yuquan, et al.
Published: (2025)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
by: Lyu, Yibo, et al.
Published: (2026)
by: Lyu, Yibo, et al.
Published: (2026)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
by: Shen, Leyang, et al.
Published: (2024)
by: Shen, Leyang, et al.
Published: (2024)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
by: Li, Zaijing, et al.
Published: (2026)
by: Li, Zaijing, et al.
Published: (2026)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
by: Lyu, Yibo, et al.
Published: (2025)
by: Lyu, Yibo, et al.
Published: (2025)
Optimus-2: Multimodal Minecraft Agent with Goal-Observation-Action Conditioned Policy
by: Li, Zaijing, et al.
Published: (2025)
by: Li, Zaijing, et al.
Published: (2025)
Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks
by: Li, Zaijing, et al.
Published: (2024)
by: Li, Zaijing, et al.
Published: (2024)
Enhancing Emotional Generation Capability of Large Language Models via Emotional Chain-of-Thought
by: Li, Zaijing, et al.
Published: (2024)
by: Li, Zaijing, et al.
Published: (2024)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
by: Zhang, Renshan, et al.
Published: (2024)
by: Zhang, Renshan, et al.
Published: (2024)
Optimus-3: Dual-Router Aligned Mixture-of-Experts Agent with Dual-Granularity Reasoning-Aware Policy Optimization
by: Li, Zaijing, et al.
Published: (2025)
by: Li, Zaijing, et al.
Published: (2025)
Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL
by: Lv, Qi, et al.
Published: (2024)
by: Lv, Qi, et al.
Published: (2024)
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
by: Chen, Yanda, et al.
Published: (2025)
by: Chen, Yanda, et al.
Published: (2025)
NetBench: A Large-Scale and Comprehensive Network Traffic Benchmark Dataset for Foundation Models
by: Qian, Chen, et al.
Published: (2024)
by: Qian, Chen, et al.
Published: (2024)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
by: Shi, Haoxiang, et al.
Published: (2025)
by: Shi, Haoxiang, et al.
Published: (2025)
Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
by: Li, Wei, et al.
Published: (2026)
by: Li, Wei, et al.
Published: (2026)
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents
by: Wang, Taiyi, et al.
Published: (2024)
by: Wang, Taiyi, et al.
Published: (2024)
STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
by: Zhang, Yongting, et al.
Published: (2024)
by: Zhang, Yongting, et al.
Published: (2024)
Beyond Syntax: Action Semantics Learning for App Agents
by: Tang, Bohan, et al.
Published: (2025)
by: Tang, Bohan, et al.
Published: (2025)
EE-MCP: Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning
by: He, Tiantian, et al.
Published: (2026)
by: He, Tiantian, et al.
Published: (2026)
AppVLM: A Lightweight Vision Language Model for Online App Control
by: Papoudakis, Georgios, et al.
Published: (2025)
by: Papoudakis, Georgios, et al.
Published: (2025)
Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement
by: Hao, Chao, et al.
Published: (2025)
by: Hao, Chao, et al.
Published: (2025)
Enhanced Mechanisms for Navigation and Tracking Services in Smart Phones
by: L.-C. Chen
Published: (2013)
by: L.-C. Chen
Published: (2013)
EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis
by: Liu, Shengyuan, et al.
Published: (2025)
by: Liu, Shengyuan, et al.
Published: (2025)
Style4D-Bench: A Benchmark Suite for 4D Stylization
by: Chen, Beiqi, et al.
Published: (2025)
by: Chen, Beiqi, et al.
Published: (2025)
Superhydrophobic and Radiative Cooling Hierarchical Membrane for High‐Performance, Durable, and Flexible Optoelectronic Artificial Synapses
by: Liqiang Xu, et al.
Published: (2025)
by: Liqiang Xu, et al.
Published: (2025)
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
by: Lv, Qi, et al.
Published: (2025)
by: Lv, Qi, et al.
Published: (2025)
WESE: Weak Exploration to Strong Exploitation for LLM Agents
by: Huang, Xu, et al.
Published: (2024)
by: Huang, Xu, et al.
Published: (2024)
Identification of Mitophagy‐Related Genes With Diagnostic Value in Atherosclerosis Using Bioinformatics Analysis and Experiment Validation
by: Zhe Chen, et al.
Published: (2026)
by: Zhe Chen, et al.
Published: (2026)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
by: Nie, Yiqi, et al.
Published: (2026)
by: Nie, Yiqi, et al.
Published: (2026)
An Evolutionary Algorithm with Probabilistic Annealing for Large-scale Sparse Multi-objective Optimization
by: Shao, Shuai, et al.
Published: (2026)
by: Shao, Shuai, et al.
Published: (2026)
DeepFake-Adapter: Dual-Level Adapter for DeepFake Detection
by: Shao, Rui, et al.
Published: (2023)
by: Shao, Rui, et al.
Published: (2023)
Similar Items
-
Less is More: Empowering GUI Agent with Context-Aware Simplification
by: Chen, Gongwei, et al.
Published: (2025) -
HiconAgent: History Context-aware Policy Optimization for GUI Agents
by: Zhou, Xurui, et al.
Published: (2025) -
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
by: Shao, Rui, et al.
Published: (2026) -
GUI Agents with Foundation Models: A Comprehensive Survey
by: Wang, Shuai, et al.
Published: (2024) -
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
by: Zhang, Renshan, et al.
Published: (2025)