MobileFlow: A Multimodal LLM For Mobile GUI Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Nong, Songqin, Zhu, Jiali, Wu, Rui, Jin, Jiongchao, Shan, Shuo, Huang, Xiutian, Xu, Wenhao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
SecAgent: Efficient Mobile GUI Agent with Semantic Context
di: Xie, Yiping, et al.
Pubblicazione: (2026)
di: Xie, Yiping, et al.
Pubblicazione: (2026)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
di: Wang, Junyang, et al.
Pubblicazione: (2026)
di: Wang, Junyang, et al.
Pubblicazione: (2026)
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
di: Lv, Rui, et al.
Pubblicazione: (2026)
di: Lv, Rui, et al.
Pubblicazione: (2026)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
di: Wang, Ziwei, et al.
Pubblicazione: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
di: Xiao, Han, et al.
Pubblicazione: (2026)
di: Xiao, Han, et al.
Pubblicazione: (2026)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
di: Zhang, Bofei, et al.
Pubblicazione: (2025)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
di: Wang, Zhenhailong, et al.
Pubblicazione: (2025)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
di: Zhou, Xurui, et al.
Pubblicazione: (2025)
di: Zhou, Xurui, et al.
Pubblicazione: (2025)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
di: Zeng, Ziyun, et al.
Pubblicazione: (2026)
di: Zeng, Ziyun, et al.
Pubblicazione: (2026)
Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2026)
di: Shaker, Abdelrahman, et al.
Pubblicazione: (2026)
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
di: Xiao, Han, et al.
Pubblicazione: (2025)
di: Xiao, Han, et al.
Pubblicazione: (2025)
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
di: Wang, Junyang, et al.
Pubblicazione: (2024)
di: Wang, Junyang, et al.
Pubblicazione: (2024)
Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation
di: Jin, Jiongchao, et al.
Pubblicazione: (2025)
di: Jin, Jiongchao, et al.
Pubblicazione: (2025)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
di: Wang, Junyang, et al.
Pubblicazione: (2025)
di: Wang, Junyang, et al.
Pubblicazione: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
di: Ren, Xiaoming, et al.
Pubblicazione: (2026)
di: Ren, Xiaoming, et al.
Pubblicazione: (2026)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
GUing: A Mobile GUI Search Engine using a Vision-Language Model
di: Wei, Jialiang, et al.
Pubblicazione: (2024)
di: Wei, Jialiang, et al.
Pubblicazione: (2024)
MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation
di: Loo, Gowen, et al.
Pubblicazione: (2025)
di: Loo, Gowen, et al.
Pubblicazione: (2025)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
di: Shi, Kai, et al.
Pubblicazione: (2025)
di: Shi, Kai, et al.
Pubblicazione: (2025)
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
di: Lu, Quanfeng, et al.
Pubblicazione: (2025)
di: Lu, Quanfeng, et al.
Pubblicazione: (2025)
Continual GUI Agents
di: Liu, Ziwei, et al.
Pubblicazione: (2026)
di: Liu, Ziwei, et al.
Pubblicazione: (2026)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
di: Shao, Rui, et al.
Pubblicazione: (2026)
di: Shao, Rui, et al.
Pubblicazione: (2026)
MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
di: Zhao, Yang, et al.
Pubblicazione: (2023)
di: Zhao, Yang, et al.
Pubblicazione: (2023)
CogAgent: A Visual Language Model for GUI Agents
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
MobileNetV4 -- Universal Models for the Mobile Ecosystem
di: Qin, Danfeng, et al.
Pubblicazione: (2024)
di: Qin, Danfeng, et al.
Pubblicazione: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
Benchmarking and Improving GUI Agents in High-Dynamic Environments
di: Liu, Enqi, et al.
Pubblicazione: (2026)
di: Liu, Enqi, et al.
Pubblicazione: (2026)
MonoMobility: Zero-Shot 3D Mobility Analysis from Monocular Videos
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
di: Zhou, Hongyi, et al.
Pubblicazione: (2025)
UItron: Foundational GUI Agent with Advanced Perception and Planning
di: Zeng, Zhixiong, et al.
Pubblicazione: (2025)
di: Zeng, Zhixiong, et al.
Pubblicazione: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
CompactFlowNet: Efficient Real-time Optical Flow Estimation on Mobile Devices
di: Znobishchev, Andrei, et al.
Pubblicazione: (2024)
di: Znobishchev, Andrei, et al.
Pubblicazione: (2024)
A Survey on (M)LLM-Based GUI Agents
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026) -
SecAgent: Efficient Mobile GUI Agent with Semantic Context
di: Xie, Yiping, et al.
Pubblicazione: (2026) -
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2026) -
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
di: Wang, Junyang, et al.
Pubblicazione: (2026) -
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
di: Lv, Rui, et al.
Pubblicazione: (2026)