See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xingyi, Ye, Yulei, Huang, Kaifeng, Li, Wenhao, Wang, Xiangfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
por: Lu, Ziyu, et al.
Publicado: (2026)
por: Lu, Ziyu, et al.
Publicado: (2026)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
See and Think: Embodied Agent in Virtual Environment
por: Zhao, Zhonghan, et al.
Publicado: (2023)
por: Zhao, Zhonghan, et al.
Publicado: (2023)
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
por: Wu, Zongru, et al.
Publicado: (2025)
por: Wu, Zongru, et al.
Publicado: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
por: Nong, Songqin, et al.
Publicado: (2025)
por: Nong, Songqin, et al.
Publicado: (2025)
AscendOptimizer: Episodic Agent for Ascend NPU Operator Optimization
por: Wu, Jiehao, et al.
Publicado: (2026)
por: Wu, Jiehao, et al.
Publicado: (2026)
GUIDE: Interpretable GUI Agent Evaluation via Hierarchical Diagnosis
por: Zhai, Yuwen, et al.
Publicado: (2026)
por: Zhai, Yuwen, et al.
Publicado: (2026)
A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation
por: Chai, Yuxiang, et al.
Publicado: (2025)
por: Chai, Yuxiang, et al.
Publicado: (2025)
OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents
por: Davydova, Mariya, et al.
Publicado: (2025)
por: Davydova, Mariya, et al.
Publicado: (2025)
Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills
por: Xie, Yuquan, et al.
Publicado: (2025)
por: Xie, Yuquan, et al.
Publicado: (2025)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
por: Liu, Yuhang, et al.
Publicado: (2025)
por: Liu, Yuhang, et al.
Publicado: (2025)
See and Remember: A Multimodal Agent for Web Traversal
por: Wang, Xinjun, et al.
Publicado: (2026)
por: Wang, Xinjun, et al.
Publicado: (2026)
Mobile-Agent-v3: Fundamental Agents for GUI Automation
por: Ye, Jiabo, et al.
Publicado: (2025)
por: Ye, Jiabo, et al.
Publicado: (2025)
HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents
por: Jin, Chao, et al.
Publicado: (2026)
por: Jin, Chao, et al.
Publicado: (2026)
Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
por: Hua, Yun, et al.
Publicado: (2025)
por: Hua, Yun, et al.
Publicado: (2025)
MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
STICKERCONV: Generating Multimodal Empathetic Responses from Scratch
por: Zhang, Yiqun, et al.
Publicado: (2024)
por: Zhang, Yiqun, et al.
Publicado: (2024)
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
por: Cai, Shaofei, et al.
Publicado: (2025)
por: Cai, Shaofei, et al.
Publicado: (2025)
A Survey of Automatic Prompt Engineering: An Optimization Perspective
por: Li, Wenwu, et al.
Publicado: (2025)
por: Li, Wenwu, et al.
Publicado: (2025)
Retrieval-augmented GUI Agents with Generative Guidelines
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
por: Xie, Bin, et al.
Publicado: (2025)
por: Xie, Bin, et al.
Publicado: (2025)
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
por: Li, Runze, et al.
Publicado: (2025)
por: Li, Runze, et al.
Publicado: (2025)
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning
por: Li, Jiahao, et al.
Publicado: (2025)
por: Li, Jiahao, et al.
Publicado: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
por: Yang, Xiao, et al.
Publicado: (2025)
por: Yang, Xiao, et al.
Publicado: (2025)
MagicGUI-RMS: A Multi-Agent Reward Model System for Self-Evolving GUI Agents via Automated Feedback Reflux
por: Li, Zecheng, et al.
Publicado: (2026)
por: Li, Zecheng, et al.
Publicado: (2026)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
por: Ye, Xianhang, et al.
Publicado: (2025)
por: Ye, Xianhang, et al.
Publicado: (2025)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
por: Gao, Longxi, et al.
Publicado: (2025)
por: Gao, Longxi, et al.
Publicado: (2025)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
por: Henry, Felix, et al.
Publicado: (2026)
por: Henry, Felix, et al.
Publicado: (2026)
Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
por: Zhao, Yuan, et al.
Publicado: (2025)
por: Zhao, Yuan, et al.
Publicado: (2025)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
por: Chen, Ruihan, et al.
Publicado: (2025)
por: Chen, Ruihan, et al.
Publicado: (2025)
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
por: Chai, Yuxiang, et al.
Publicado: (2026)
por: Chai, Yuxiang, et al.
Publicado: (2026)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
por: Hu, Xuhao, et al.
Publicado: (2026)
por: Hu, Xuhao, et al.
Publicado: (2026)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
por: Wu, Yubin, et al.
Publicado: (2026)
por: Wu, Yubin, et al.
Publicado: (2026)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
por: Chen, Chen, et al.
Publicado: (2026)
por: Chen, Chen, et al.
Publicado: (2026)
GTA1: GUI Test-time Scaling Agent
por: Yang, Yan, et al.
Publicado: (2025)
por: Yang, Yan, et al.
Publicado: (2025)
Complementary Information Mutual Learning for Multimodality Medical Image Segmentation
por: Shen, Chuyun, et al.
Publicado: (2024)
por: Shen, Chuyun, et al.
Publicado: (2024)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
por: Sun, Yuchen, et al.
Publicado: (2025)
por: Sun, Yuchen, et al.
Publicado: (2025)
Where Paths Collide: A Comprehensive Survey of Classic and Learning-Based Multi-Agent Pathfinding
por: Wang, Shiyue, et al.
Publicado: (2025)
por: Wang, Shiyue, et al.
Publicado: (2025)
Hybrid Self-evolving Structured Memory for GUI Agents
por: Zhu, Sibo, et al.
Publicado: (2026)
por: Zhu, Sibo, et al.
Publicado: (2026)
Ejemplares similares
-
BEAP-Agent: Backtrackable Execution and Adaptive Planning for GUI Agents
por: Lu, Ziyu, et al.
Publicado: (2026) -
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
por: Cheng, Kanzhi, et al.
Publicado: (2024) -
See and Think: Embodied Agent in Virtual Environment
por: Zhao, Zhonghan, et al.
Publicado: (2023) -
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
por: Wu, Zongru, et al.
Publicado: (2025) -
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
por: Nong, Songqin, et al.
Publicado: (2025)