Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Suyuchen, Zhang, Tianyu, Masry, Ahmed, Pal, Christopher, Gella, Spandana, Liu, Bang, Taslakian, Perouz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StarFlow: Generating Structured Workflow Outputs From Sketch Images
di: Bechard, Patrice, et al.
Pubblicazione: (2025)
di: Bechard, Patrice, et al.
Pubblicazione: (2025)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
di: Nayak, Shravan, et al.
Pubblicazione: (2025)
Scope: Selective Cross-modal Orchestration of Visual Perception Experts
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
Rendering-Aware Reinforcement Learning for Vector Graphics Generation
di: Rodriguez, Juan A., et al.
Pubblicazione: (2025)
di: Rodriguez, Juan A., et al.
Pubblicazione: (2025)
VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing
di: Rodriguez, Juan, et al.
Pubblicazione: (2026)
di: Rodriguez, Juan, et al.
Pubblicazione: (2026)
Mem-$π$: Adaptive Memory through Learning When and What to Generate
di: Wang, Xiaoqiang, et al.
Pubblicazione: (2026)
di: Wang, Xiaoqiang, et al.
Pubblicazione: (2026)
WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation
di: Awal, Rabiul, et al.
Pubblicazione: (2025)
di: Awal, Rabiul, et al.
Pubblicazione: (2025)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
di: Wu, Qianhui, et al.
Pubblicazione: (2025)
VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
di: Ye, Xianhang, et al.
Pubblicazione: (2025)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
di: Abaskohi, Amirhossein, et al.
Pubblicazione: (2024)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
di: Pei, Siqi, et al.
Pubblicazione: (2026)
di: Pei, Siqi, et al.
Pubblicazione: (2026)
Improved GUI Grounding via Iterative Narrowing
di: Nguyen, Anthony
Pubblicazione: (2024)
di: Nguyen, Anthony
Pubblicazione: (2024)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
BAMI: Training-Free Bias Mitigation in GUI Grounding
di: Zhang, Borui, et al.
Pubblicazione: (2026)
di: Zhang, Borui, et al.
Pubblicazione: (2026)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
di: Lei, Bin, et al.
Pubblicazione: (2025)
di: Lei, Bin, et al.
Pubblicazione: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
di: Zhang, Miaosen, et al.
Pubblicazione: (2025)
CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
di: Jian, Xiangru, et al.
Pubblicazione: (2026)
di: Jian, Xiangru, et al.
Pubblicazione: (2026)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
di: Zhang, Yan, et al.
Pubblicazione: (2026)
di: Zhang, Yan, et al.
Pubblicazione: (2026)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
di: Ma, Longhui, et al.
Pubblicazione: (2026)
di: Ma, Longhui, et al.
Pubblicazione: (2026)
Learning Active Perception via Self-Evolving Preference Optimization for GUI Grounding
di: Wang, Wanfu, et al.
Pubblicazione: (2025)
di: Wang, Wanfu, et al.
Pubblicazione: (2025)
GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
di: Liu, Tao, et al.
Pubblicazione: (2025)
di: Liu, Tao, et al.
Pubblicazione: (2025)
GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
di: Gao, Xiangjun, et al.
Pubblicazione: (2026)
di: Gao, Xiangjun, et al.
Pubblicazione: (2026)
Visual Test-time Scaling for GUI Agent Grounding
di: Luo, Tiange, et al.
Pubblicazione: (2025)
di: Luo, Tiange, et al.
Pubblicazione: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
di: Zhou, Yuqi, et al.
Pubblicazione: (2025)
Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2025)
HeightMapNet: Explicit Height Modeling for End-to-End HD Map Learning
di: Qiu, Wenzhao, et al.
Pubblicazione: (2024)
di: Qiu, Wenzhao, et al.
Pubblicazione: (2024)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
di: Fan, Yue, et al.
Pubblicazione: (2025)
di: Fan, Yue, et al.
Pubblicazione: (2025)
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
di: Hsieh, ZongHan, et al.
Pubblicazione: (2025)
di: Hsieh, ZongHan, et al.
Pubblicazione: (2025)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
di: Tang, Fei, et al.
Pubblicazione: (2026)
di: Tang, Fei, et al.
Pubblicazione: (2026)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
di: Du, Yong, et al.
Pubblicazione: (2025)
di: Du, Yong, et al.
Pubblicazione: (2025)
On the Application of Efficient Neural Mapping to Real-Time Indoor Localisation for Unmanned Ground Vehicles
di: Holder, Christopher J., et al.
Pubblicazione: (2022)
di: Holder, Christopher J., et al.
Pubblicazione: (2022)
Documenti analoghi
-
StarFlow: Generating Structured Workflow Outputs From Sketch Images
di: Bechard, Patrice, et al.
Pubblicazione: (2025) -
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
di: Nayak, Shravan, et al.
Pubblicazione: (2025) -
Scope: Selective Cross-modal Orchestration of Visual Perception Experts
di: Zhang, Tianyu, et al.
Pubblicazione: (2025) -
Rendering-Aware Reinforcement Learning for Vector Graphics Generation
di: Rodriguez, Juan A., et al.
Pubblicazione: (2025) -
VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing
di: Rodriguez, Juan, et al.
Pubblicazione: (2026)