Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Zhiyuan, Xie, Shenghao, Li, Wenyi, Zu, Wenqiang, Li, Peihang, Qiu, Jiahao, Pei, Siqi, Ma, Lei, Huang, Tiejun, Wang, Mengdi, Liu, Shilong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
par: Pei, Siqi, et autres
Publié: (2026)
par: Pei, Siqi, et autres
Publié: (2026)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
FIZZ: Factual Inconsistency Detection by Zoom-in Summary and Zoom-out Document
par: Yang, Joonho, et autres
Publié: (2024)
par: Yang, Joonho, et autres
Publié: (2024)
Zoom and Shift are All You Need
par: Qin, Jiahao
Publié: (2024)
par: Qin, Jiahao
Publié: (2024)
Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
par: Wei, Lai, et autres
Publié: (2026)
par: Wei, Lai, et autres
Publié: (2026)
Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector
par: Zu, Wenqiang, et autres
Publié: (2026)
par: Zu, Wenqiang, et autres
Publié: (2026)
ZoomTable: Interactive Exploration of Data Facts in Hierarchical Tables via Semantic Zooming
par: Chen, Qiyang, et autres
Publié: (2026)
par: Chen, Qiyang, et autres
Publié: (2026)
AttZoom: Attention Zoom for Better Visual Features
par: DeAlcala, Daniel, et autres
Publié: (2025)
par: DeAlcala, Daniel, et autres
Publié: (2025)
Pre-trained Models Succeed in Medical Imaging with Representation Similarity Degradation
par: Zu, Wenqiang, et autres
Publié: (2025)
par: Zu, Wenqiang, et autres
Publié: (2025)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Code Semantic Zooming
par: Ba, Jinsheng, et autres
Publié: (2025)
par: Ba, Jinsheng, et autres
Publié: (2025)
Embedded Visual Prompt Tuning
par: Zu, Wenqiang, et autres
Publié: (2024)
par: Zu, Wenqiang, et autres
Publié: (2024)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming
par: Erzurumlu, Yunus Talha, et autres
Publié: (2026)
par: Erzurumlu, Yunus Talha, et autres
Publié: (2026)
WinClick: GUI Grounding with Multimodal Large Language Models
par: Hui, Zheng, et autres
Publié: (2025)
par: Hui, Zheng, et autres
Publié: (2025)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
par: Li, Aiden Yiliu, et autres
Publié: (2025)
par: Li, Aiden Yiliu, et autres
Publié: (2025)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement
par: Yu, Xuan, et autres
Publié: (2025)
par: Yu, Xuan, et autres
Publié: (2025)
GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance
par: Shi, Jiale, et autres
Publié: (2026)
par: Shi, Jiale, et autres
Publié: (2026)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Towards Unifying Understanding and Generation in the Era of Vision Foundation Models: A Survey from the Autoregression Perspective
par: Xie, Shenghao, et autres
Publié: (2024)
par: Xie, Shenghao, et autres
Publié: (2024)
HeadZoom: Hands-Free Zooming and Panning for 2D Image Navigation Using Head Motion
par: Zhang, Kaining, et autres
Publié: (2025)
par: Zhang, Kaining, et autres
Publié: (2025)
Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception
par: Yang, Jiashu, et autres
Publié: (2025)
par: Yang, Jiashu, et autres
Publié: (2025)
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
par: Li, Hongxin, et autres
Publié: (2026)
par: Li, Hongxin, et autres
Publié: (2026)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
par: Shen, Haozhan, et autres
Publié: (2024)
par: Shen, Haozhan, et autres
Publié: (2024)
Learning High-Quality Navigation and Zooming on Omnidirectional Images in Virtual Reality
par: Cao, Zidong, et autres
Publié: (2024)
par: Cao, Zidong, et autres
Publié: (2024)
Learn From Zoom: Decoupled Supervised Contrastive Learning For WCE Image Classification
par: Qiu, Kunpeng, et autres
Publié: (2024)
par: Qiu, Kunpeng, et autres
Publié: (2024)
Zoom to Essence: Trainless GUI Grounding by Inferring upon Interface Elements
par: Liu, Ziwei, et autres
Publié: (2026)
par: Liu, Ziwei, et autres
Publié: (2026)
Dual-Camera Smooth Zoom on Mobile Phones
par: Wu, Renlong, et autres
Publié: (2024)
par: Wu, Renlong, et autres
Publié: (2024)
Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines
par: Kim, Keon, et autres
Publié: (2026)
par: Kim, Keon, et autres
Publié: (2026)
Seeing the Unseen: Zooming in the Dark with Event Cameras
par: Kai, Dachun, et autres
Publié: (2026)
par: Kai, Dachun, et autres
Publié: (2026)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
par: Luan, Bozhi, et autres
Publié: (2024)
par: Luan, Bozhi, et autres
Publié: (2024)
Semantic Zooming and Edge Bundling for Multi-Scale Supply Chain Flow Visualization
par: Li, Songmao, et autres
Publié: (2026)
par: Li, Songmao, et autres
Publié: (2026)
Efficient OpAmp Adaptation for Zoom Attention to Golden Contexts
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Adaptive Image Zoom-in with Bounding Box Transformation for UAV Object Detection
par: Wang, Tao, et autres
Publié: (2026)
par: Wang, Tao, et autres
Publié: (2026)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
par: Shi, Yuheng, et autres
Publié: (2026)
par: Shi, Yuheng, et autres
Publié: (2026)
SpectralZoom: Efficient Segmentation with an Adaptive Hyperspectral Camera
par: Arnold, Jackson, et autres
Publié: (2024)
par: Arnold, Jackson, et autres
Publié: (2024)
Zooming In on Copyright with Integrated Library Software Services
par: Oye, Karen
Publié: (2007)
par: Oye, Karen
Publié: (2007)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
par: Li, Xudong, et autres
Publié: (2025)
par: Li, Xudong, et autres
Publié: (2025)
Documents similaires
-
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
par: Pei, Siqi, et autres
Publié: (2026) -
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
par: Tang, Fei, et autres
Publié: (2026) -
FIZZ: Factual Inconsistency Detection by Zoom-in Summary and Zoom-out Document
par: Yang, Joonho, et autres
Publié: (2024) -
Zoom and Shift are All You Need
par: Qin, Jiahao
Publié: (2024) -
Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
par: Wei, Lai, et autres
Publié: (2026)