GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Chen, Shao, Jiawei, Lu, Dakuan, Hu, Haoyi, Liu, Xiangcheng, Yao, Hantao, Liu, Wu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
von: Ye, Xianhang, et al.
Veröffentlicht: (2025)
von: Ye, Xianhang, et al.
Veröffentlicht: (2025)
GUI-PRA: Process Reward Agent for GUI Tasks
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
von: Xiong, Tao, et al.
Veröffentlicht: (2025)
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
von: Chen, Ruihan, et al.
Veröffentlicht: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
von: Liu, Yichao, et al.
Veröffentlicht: (2026)
von: Liu, Yichao, et al.
Veröffentlicht: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
von: Yuan, Xinbin, et al.
Veröffentlicht: (2025)
von: Yuan, Xinbin, et al.
Veröffentlicht: (2025)
GUI-explorer: Autonomous Exploration and Mining of Transition-aware Knowledge for GUI Agent
von: Xie, Bin, et al.
Veröffentlicht: (2025)
von: Xie, Bin, et al.
Veröffentlicht: (2025)
LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
von: Wu, Yubin, et al.
Veröffentlicht: (2026)
von: Wu, Yubin, et al.
Veröffentlicht: (2026)
META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
von: Sun, Liangtai, et al.
Veröffentlicht: (2022)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
von: Yang, Jingqi, et al.
Veröffentlicht: (2025)
von: Yang, Jingqi, et al.
Veröffentlicht: (2025)
MP-GUI: Modality Perception with MLLMs for GUI Understanding
von: Wang, Ziwei, et al.
Veröffentlicht: (2025)
von: Wang, Ziwei, et al.
Veröffentlicht: (2025)
InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills
von: Xie, Yuquan, et al.
Veröffentlicht: (2025)
von: Xie, Yuquan, et al.
Veröffentlicht: (2025)
Aria-UI: Visual Grounding for GUI Instructions
von: Yang, Yuhao, et al.
Veröffentlicht: (2024)
von: Yang, Yuhao, et al.
Veröffentlicht: (2024)
ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
von: Hu, Xuhao, et al.
Veröffentlicht: (2026)
von: Hu, Xuhao, et al.
Veröffentlicht: (2026)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
von: Wu, Hang, et al.
Veröffentlicht: (2025)
von: Wu, Hang, et al.
Veröffentlicht: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
von: Kumbhar, Shrinidhi, et al.
Veröffentlicht: (2026)
von: Kumbhar, Shrinidhi, et al.
Veröffentlicht: (2026)
Visual Test-time Scaling for GUI Agent Grounding
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
von: Luo, Tiange, et al.
Veröffentlicht: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
von: Zhang, Miaosen, et al.
Veröffentlicht: (2025)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2025)
MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
von: Zhao, Pengxiang, et al.
Veröffentlicht: (2025)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
von: Nong, Songqin, et al.
Veröffentlicht: (2025)
von: Nong, Songqin, et al.
Veröffentlicht: (2025)
Faithful Mobile GUI Agents with Guided Advantage Estimator
von: Hu, Haowen, et al.
Veröffentlicht: (2026)
von: Hu, Haowen, et al.
Veröffentlicht: (2026)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
von: Zhou, Yuqi, et al.
Veröffentlicht: (2025)
von: Zhou, Yuqi, et al.
Veröffentlicht: (2025)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
von: Pei, Siqi, et al.
Veröffentlicht: (2026)
von: Pei, Siqi, et al.
Veröffentlicht: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
von: Lei, Bin, et al.
Veröffentlicht: (2025)
von: Lei, Bin, et al.
Veröffentlicht: (2025)
InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
von: Liu, Yuhang, et al.
Veröffentlicht: (2025)
GUI Agents: A Survey
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
von: Tang, Fei, et al.
Veröffentlicht: (2025)
von: Tang, Fei, et al.
Veröffentlicht: (2025)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
von: Chen, Cong, et al.
Veröffentlicht: (2025)
von: Chen, Cong, et al.
Veröffentlicht: (2025)
PIRA-Bench: A Transition from Reactive GUI Agents to GUI-based Proactive Intent Recommendation Agents
von: Chai, Yuxiang, et al.
Veröffentlicht: (2026)
von: Chai, Yuxiang, et al.
Veröffentlicht: (2026)
OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
von: Henry, Felix, et al.
Veröffentlicht: (2026)
von: Henry, Felix, et al.
Veröffentlicht: (2026)
PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent
von: Nie, Hongyi, et al.
Veröffentlicht: (2026)
von: Nie, Hongyi, et al.
Veröffentlicht: (2026)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
von: Gao, Longxi, et al.
Veröffentlicht: (2025)
von: Gao, Longxi, et al.
Veröffentlicht: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
von: Kang, Weitai, et al.
Veröffentlicht: (2025)
von: Kang, Weitai, et al.
Veröffentlicht: (2025)
DocOS: Towards Proactive Document-Guided Actions in GUI Agents
von: Liu, Jingjing, et al.
Veröffentlicht: (2026)
von: Liu, Jingjing, et al.
Veröffentlicht: (2026)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
von: Wu, Penghao, et al.
Veröffentlicht: (2025)
von: Wu, Penghao, et al.
Veröffentlicht: (2025)
VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation
von: Ye, Ziang, et al.
Veröffentlicht: (2025)
von: Ye, Ziang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
von: Ye, Xianhang, et al.
Veröffentlicht: (2025) -
GUI-PRA: Process Reward Agent for GUI Tasks
von: Xiong, Tao, et al.
Veröffentlicht: (2025) -
MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents
von: Chen, Ruihan, et al.
Veröffentlicht: (2025) -
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024) -
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
von: Liu, Yichao, et al.
Veröffentlicht: (2026)