MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Ziyun, Hua, Hang, Zou, Bocheng, Cai, Mu, Feris, Rogerio, Luo, Jiebo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
di: Shi, Yibo, et al.
Pubblicazione: (2026)
di: Shi, Yibo, et al.
Pubblicazione: (2026)
PromptFix: You Prompt and We Fix the Photo
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
Aurora: Unified Video Editing with a Tool-Using Agent
di: Yu, Yongsheng, et al.
Pubblicazione: (2026)
di: Yu, Yongsheng, et al.
Pubblicazione: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
Agent Skills Should Go Beyond Text: The Case for Visual Skills
di: Xu, Binxiao, et al.
Pubblicazione: (2026)
di: Xu, Binxiao, et al.
Pubblicazione: (2026)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
Continual GUI Agents
di: Liu, Ziwei, et al.
Pubblicazione: (2026)
di: Liu, Ziwei, et al.
Pubblicazione: (2026)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
MobileFlow: A Multimodal LLM For Mobile GUI Agent
di: Nong, Songqin, et al.
Pubblicazione: (2024)
di: Nong, Songqin, et al.
Pubblicazione: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
di: Wang, Xuehui, et al.
Pubblicazione: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
Mem-W: Latent Memory-Native GUI Agents
di: Zhang, Guibin, et al.
Pubblicazione: (2026)
di: Zhang, Guibin, et al.
Pubblicazione: (2026)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
di: Gao, Xinzge, et al.
Pubblicazione: (2025)
di: Gao, Xinzge, et al.
Pubblicazione: (2025)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
di: Zhang, Ziyun, et al.
Pubblicazione: (2026)
di: Zhang, Ziyun, et al.
Pubblicazione: (2026)
POINTS-GUI-G: GUI-Grounding Journey
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
di: Zhao, Zhongyin, et al.
Pubblicazione: (2026)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
di: Wang, Junyang, et al.
Pubblicazione: (2026)
di: Wang, Junyang, et al.
Pubblicazione: (2026)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
di: Huang, Brandon, et al.
Pubblicazione: (2025)
di: Huang, Brandon, et al.
Pubblicazione: (2025)
Auto-scaling Continuous Memory for GUI Agent
di: Wu, Wenyi, et al.
Pubblicazione: (2025)
di: Wu, Wenyi, et al.
Pubblicazione: (2025)
UItron: Foundational GUI Agent with Advanced Perception and Planning
di: Zeng, Zhixiong, et al.
Pubblicazione: (2025)
di: Zeng, Zhixiong, et al.
Pubblicazione: (2025)
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents
di: Xiao, Han, et al.
Pubblicazione: (2026)
di: Xiao, Han, et al.
Pubblicazione: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Step-GUI Technical Report
di: Yan, Haolong, et al.
Pubblicazione: (2025)
di: Yan, Haolong, et al.
Pubblicazione: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
di: Hu, Junan, et al.
Pubblicazione: (2026)
di: Hu, Junan, et al.
Pubblicazione: (2026)
CGL: Advancing Continual GUI Learning via Reinforcement Fine-Tuning
di: Yao, Zhenquan, et al.
Pubblicazione: (2026)
di: Yao, Zhenquan, et al.
Pubblicazione: (2026)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
di: Li, Junlong, et al.
Pubblicazione: (2026)
di: Li, Junlong, et al.
Pubblicazione: (2026)
Visual Test-time Scaling for GUI Agent Grounding
di: Luo, Tiange, et al.
Pubblicazione: (2025)
di: Luo, Tiange, et al.
Pubblicazione: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
di: Cao, Yue, et al.
Pubblicazione: (2025)
di: Cao, Yue, et al.
Pubblicazione: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
di: Yang, Chenyu, et al.
Pubblicazione: (2025)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
di: Hua, Hang, et al.
Pubblicazione: (2025)
di: Hua, Hang, et al.
Pubblicazione: (2025)
SecAgent: Efficient Mobile GUI Agent with Semantic Context
di: Xie, Yiping, et al.
Pubblicazione: (2026)
di: Xie, Yiping, et al.
Pubblicazione: (2026)
CogAgent: A Visual Language Model for GUI Agents
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
di: Hong, Wenyi, et al.
Pubblicazione: (2023)
Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments
di: Zhang, Yitong, et al.
Pubblicazione: (2025)
di: Zhang, Yitong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025) -
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
di: Shi, Yibo, et al.
Pubblicazione: (2026) -
PromptFix: You Prompt and We Fix the Photo
di: Yu, Yongsheng, et al.
Pubblicazione: (2024) -
Aurora: Unified Video Editing with a Tool-Using Agent
di: Yu, Yongsheng, et al.
Pubblicazione: (2026) -
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)