Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhenhailong, Xu, Haiyang, Wang, Junyang, Zhang, Xi, Yan, Ming, Zhang, Ji, Huang, Fei, Ji, Heng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
par: Wang, Junyang, et autres
Publié: (2025)
par: Wang, Junyang, et autres
Publié: (2025)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
par: Wang, Junyang, et autres
Publié: (2026)
par: Wang, Junyang, et autres
Publié: (2026)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
par: Wang, Junyang, et autres
Publié: (2025)
par: Wang, Junyang, et autres
Publié: (2025)
PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC
par: Liu, Haowei, et autres
Publié: (2025)
par: Liu, Haowei, et autres
Publié: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
par: Wang, Junyang, et autres
Publié: (2023)
par: Wang, Junyang, et autres
Publié: (2023)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
par: Cheng, Kanzhi, et autres
Publié: (2026)
par: Cheng, Kanzhi, et autres
Publié: (2026)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning
par: Zhang, Xuejun, et autres
Publié: (2026)
par: Zhang, Xuejun, et autres
Publié: (2026)
MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation
par: Loo, Gowen, et autres
Publié: (2025)
par: Loo, Gowen, et autres
Publié: (2025)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
par: Lu, Xudong, et autres
Publié: (2026)
par: Lu, Xudong, et autres
Publié: (2026)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
par: Chu, Xiangxiang, et autres
Publié: (2023)
par: Chu, Xiangxiang, et autres
Publié: (2023)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
par: Tian, Xueyun, et autres
Publié: (2026)
par: Tian, Xueyun, et autres
Publié: (2026)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
par: Ye, Jiabo, et autres
Publié: (2024)
par: Ye, Jiabo, et autres
Publié: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
par: Ye, Qinghao, et autres
Publié: (2023)
par: Ye, Qinghao, et autres
Publié: (2023)
Generalization in Online Reinforcement Learning for Mobile Agents
par: Gu, Li, et autres
Publié: (2026)
par: Gu, Li, et autres
Publié: (2026)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
par: Kim, Jeonghwan, et autres
Publié: (2024)
par: Kim, Jeonghwan, et autres
Publié: (2024)
Multimedia Generative Script Learning for Task Planning
par: Wang, Qingyun, et autres
Publié: (2022)
par: Wang, Qingyun, et autres
Publié: (2022)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
par: Zhao, Haozhe, et autres
Publié: (2026)
par: Zhao, Haozhe, et autres
Publié: (2026)
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
par: Zhang, Lu, et autres
Publié: (2024)
par: Zhang, Lu, et autres
Publié: (2024)
UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
par: Xiao, Han, et autres
Publié: (2025)
par: Xiao, Han, et autres
Publié: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
par: Xiao, Han, et autres
Publié: (2026)
par: Xiao, Han, et autres
Publié: (2026)
ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
par: Xu, Zhenran, et autres
Publié: (2025)
par: Xu, Zhenran, et autres
Publié: (2025)
Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboration
par: Wang, Zhenhailong, et autres
Publié: (2023)
par: Wang, Zhenhailong, et autres
Publié: (2023)
AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization
par: Du, Yiyang, et autres
Publié: (2025)
par: Du, Yiyang, et autres
Publié: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
par: Hong, Jixiang, et autres
Publié: (2025)
par: Hong, Jixiang, et autres
Publié: (2025)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)
par: An, Dong, et autres
Publié: (2023)
BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
par: Zhan, Qiusi, et autres
Publié: (2025)
par: Zhan, Qiusi, et autres
Publié: (2025)
SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments
par: Li, Dinging, et autres
Publié: (2026)
par: Li, Dinging, et autres
Publié: (2026)
Imp: Highly Capable Large Multimodal Models for Mobile Devices
par: Shao, Zhenwei, et autres
Publié: (2024)
par: Shao, Zhenwei, et autres
Publié: (2024)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
par: Luo, Fuwen, et autres
Publié: (2025)
par: Luo, Fuwen, et autres
Publié: (2025)
MARS: Memory-Enhanced Agents with Reflective Self-improvement
par: Liang, Xuechen, et autres
Publié: (2025)
par: Liang, Xuechen, et autres
Publié: (2025)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
par: Xu, Haiyang, et autres
Publié: (2026)
par: Xu, Haiyang, et autres
Publié: (2026)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
par: Zhang, Liang, et autres
Publié: (2024)
par: Zhang, Liang, et autres
Publié: (2024)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
par: Ji, Yifan, et autres
Publié: (2026)
par: Ji, Yifan, et autres
Publié: (2026)
Documents similaires
-
Mobile-Agent-v2: Mobile Device Operation Assistant with Effective Navigation via Multi-Agent Collaboration
par: Wang, Junyang, et autres
Publié: (2024) -
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
par: Wang, Junyang, et autres
Publié: (2025) -
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024) -
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
par: Wang, Junyang, et autres
Publié: (2026) -
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
par: Wang, Junyang, et autres
Publié: (2025)