A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiahao, Huang, Kaer |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GUI Agents with Foundation Models: A Comprehensive Survey
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
par: Gao, Longxi, et autres
Publié: (2025)
par: Gao, Longxi, et autres
Publié: (2025)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025)
par: Tang, Liujian, et autres
Publié: (2025)
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
par: Yuan, Xinbin, et autres
Publié: (2025)
par: Yuan, Xinbin, et autres
Publié: (2025)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
par: Wu, Yubin, et autres
Publié: (2026)
par: Wu, Yubin, et autres
Publié: (2026)
UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
par: Lu, Zhengxi, et autres
Publié: (2025)
par: Lu, Zhengxi, et autres
Publié: (2025)
GUI Agents: A Survey
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
par: Pei, Siqi, et autres
Publié: (2026)
par: Pei, Siqi, et autres
Publié: (2026)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
par: Chen, Ruihan, et autres
Publié: (2025)
par: Chen, Ruihan, et autres
Publié: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
par: Nong, Songqin, et autres
Publié: (2025)
par: Nong, Songqin, et autres
Publié: (2025)
GUI Agents with Reinforcement Learning: Toward Digital Inhabitants
par: Hu, Junan, et autres
Publié: (2026)
par: Hu, Junan, et autres
Publié: (2026)
Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
par: Cheng, Yuhao, et autres
Publié: (2025)
par: Cheng, Yuhao, et autres
Publié: (2025)
Large Language Model-Brained GUI Agents: A Survey
par: Zhang, Chaoyun, et autres
Publié: (2024)
par: Zhang, Chaoyun, et autres
Publié: (2024)
A Survey on Explainable Deep Reinforcement Learning
par: Cheng, Zelei, et autres
Publié: (2025)
par: Cheng, Zelei, et autres
Publié: (2025)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
par: Xu, Yifan, et autres
Publié: (2025)
par: Xu, Yifan, et autres
Publié: (2025)
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
par: Li, Zecheng, et autres
Publié: (2026)
par: Li, Zecheng, et autres
Publié: (2026)
MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning
par: Nesterova, Maria, et autres
Publié: (2026)
par: Nesterova, Maria, et autres
Publié: (2026)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
par: Ye, Xianhang, et autres
Publié: (2025)
par: Ye, Xianhang, et autres
Publié: (2025)
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
par: Chai, Yuxiang, et autres
Publié: (2026)
par: Chai, Yuxiang, et autres
Publié: (2026)
GUI-PRA: Process Reward Agent for GUI Tasks
par: Xiong, Tao, et autres
Publié: (2025)
par: Xiong, Tao, et autres
Publié: (2025)
MobileDreamer: Generative Sketch World Model for GUI Agent
par: Cao, Yilin, et autres
Publié: (2026)
par: Cao, Yilin, et autres
Publié: (2026)
See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
par: Zhang, Xingyi, et autres
Publié: (2026)
par: Zhang, Xingyi, et autres
Publié: (2026)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
par: Xie, Bin, et autres
Publié: (2025)
par: Xie, Bin, et autres
Publié: (2025)
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
par: Lu, Ziyu, et autres
Publié: (2026)
par: Lu, Ziyu, et autres
Publié: (2026)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
par: Chen, Chen, et autres
Publié: (2026)
par: Chen, Chen, et autres
Publié: (2026)
GTA1: GUI Test-time Scaling Agent
par: Yang, Yan, et autres
Publié: (2025)
par: Yang, Yan, et autres
Publié: (2025)
BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
par: Wu, Qinzhuo, et autres
Publié: (2025)
par: Wu, Qinzhuo, et autres
Publié: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
par: Zhao, Kangjia, et autres
Publié: (2024)
par: Zhao, Kangjia, et autres
Publié: (2024)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
par: Henry, Felix, et autres
Publié: (2026)
par: Henry, Felix, et autres
Publié: (2026)
Reinforcement Learning Foundations for Deep Research Systems: A Survey
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
par: Li, Runze, et autres
Publié: (2025)
par: Li, Runze, et autres
Publié: (2025)
Mobile-Agent-v3: Fundamental Agents for GUI Automation
par: Ye, Jiabo, et autres
Publié: (2025)
par: Ye, Jiabo, et autres
Publié: (2025)
A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation
par: Chai, Yuxiang, et autres
Publié: (2025)
par: Chai, Yuxiang, et autres
Publié: (2025)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
par: Gao, Xinzge, et autres
Publié: (2025)
par: Gao, Xinzge, et autres
Publié: (2025)
Foundations and Recent Trends in Multimodal Mobile Agents: A Survey
par: Wu, Biao, et autres
Publié: (2024)
par: Wu, Biao, et autres
Publié: (2024)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
par: Yang, Jingqi, et autres
Publié: (2025)
par: Yang, Jingqi, et autres
Publié: (2025)
Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents
par: Wei, Jinjie, et autres
Publié: (2025)
par: Wei, Jinjie, et autres
Publié: (2025)
Executable Agentic Memory for GUI Agent
par: Qin, Zerui, et autres
Publié: (2026)
par: Qin, Zerui, et autres
Publié: (2026)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
Documents similaires
-
GUI Agents with Foundation Models: A Comprehensive Survey
par: Wang, Shuai, et autres
Publié: (2024) -
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
par: Gao, Longxi, et autres
Publié: (2025) -
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025) -
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
par: Yuan, Xinbin, et autres
Publié: (2025) -
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
par: Wu, Yubin, et autres
Publié: (2026)