What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Jiaping, Shen, Fei, Li, Junzhe, Nie, Ping, Yu, Fei, Li, Ming, Li, Haizhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
por: Li, Weiming, et al.
Publicado: (2025)
por: Li, Weiming, et al.
Publicado: (2025)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
por: Guo, Chaohong, et al.
Publicado: (2025)
por: Guo, Chaohong, et al.
Publicado: (2025)
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
por: Li, Hongxin, et al.
Publicado: (2025)
por: Li, Hongxin, et al.
Publicado: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
POINTS-GUI-G: GUI-Grounding Journey
por: Zhao, Zhongyin, et al.
Publicado: (2026)
por: Zhao, Zhongyin, et al.
Publicado: (2026)
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
por: Li, Junlong, et al.
Publicado: (2026)
por: Li, Junlong, et al.
Publicado: (2026)
Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels
por: Zong, Yongshuo, et al.
Publicado: (2025)
por: Zong, Yongshuo, et al.
Publicado: (2025)
ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents
por: Wang, Xiaoce, et al.
Publicado: (2026)
por: Wang, Xiaoce, et al.
Publicado: (2026)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
por: Du, Yong, et al.
Publicado: (2025)
por: Du, Yong, et al.
Publicado: (2025)
Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks
por: Li, Chenjun
Publicado: (2026)
por: Li, Chenjun
Publicado: (2026)
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
por: Li, Hongxin, et al.
Publicado: (2026)
por: Li, Hongxin, et al.
Publicado: (2026)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
What Happens Next? Next Scene Prediction with a Unified Video Model
por: Li, Xinjie, et al.
Publicado: (2025)
por: Li, Xinjie, et al.
Publicado: (2025)
VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs
por: Kolli, Govinda, et al.
Publicado: (2026)
por: Kolli, Govinda, et al.
Publicado: (2026)
VenusBench-GD: A Comprehensive Multi-Platform GUI Benchmark for Diverse Grounding Tasks
por: Zhou, Beitong, et al.
Publicado: (2025)
por: Zhou, Beitong, et al.
Publicado: (2025)
Motion Modes: What Could Happen Next?
por: Pandey, Karran, et al.
Publicado: (2024)
por: Pandey, Karran, et al.
Publicado: (2024)
MVP: Multiple View Prediction Improves GUI Grounding
por: Zhang, Yunzhu, et al.
Publicado: (2025)
por: Zhang, Yunzhu, et al.
Publicado: (2025)
Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2026)
por: Tang, Fei, et al.
Publicado: (2026)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
por: Ye, Xianhang, et al.
Publicado: (2025)
por: Ye, Xianhang, et al.
Publicado: (2025)
What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models
por: Nie, Sen, et al.
Publicado: (2026)
por: Nie, Sen, et al.
Publicado: (2026)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
por: He, Jixuan, et al.
Publicado: (2026)
por: He, Jixuan, et al.
Publicado: (2026)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
por: Pei, Siqi, et al.
Publicado: (2026)
por: Pei, Siqi, et al.
Publicado: (2026)
Geometry-Grounded Gaussian Splatting
por: Zhang, Baowen, et al.
Publicado: (2026)
por: Zhang, Baowen, et al.
Publicado: (2026)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
por: Zhang, Yan, et al.
Publicado: (2026)
por: Zhang, Yan, et al.
Publicado: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
por: Wu, Qianhui, et al.
Publicado: (2025)
por: Wu, Qianhui, et al.
Publicado: (2025)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
por: Guo, Chaohong, et al.
Publicado: (2026)
por: Guo, Chaohong, et al.
Publicado: (2026)
Perceptual Inductive Bias Is What You Need Before Contrastive Learning
por: Li, Tianqin, et al.
Publicado: (2025)
por: Li, Tianqin, et al.
Publicado: (2025)
GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration
por: Fan, Yue, et al.
Publicado: (2025)
por: Fan, Yue, et al.
Publicado: (2025)
Continuous Speculative Decoding for Autoregressive Image Generation
por: Wang, Zili, et al.
Publicado: (2024)
por: Wang, Zili, et al.
Publicado: (2024)
Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning
por: Chang, Chun-Peng, et al.
Publicado: (2026)
por: Chang, Chun-Peng, et al.
Publicado: (2026)
On the Robustness of GUI Grounding Models Against Image Attacks
por: Zhao, Haoren, et al.
Publicado: (2025)
por: Zhao, Haoren, et al.
Publicado: (2025)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
por: Xu, Hai-Ming, et al.
Publicado: (2024)
por: Xu, Hai-Ming, et al.
Publicado: (2024)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
por: Lei, Bin, et al.
Publicado: (2025)
por: Lei, Bin, et al.
Publicado: (2025)
VSE-MOT: Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Enhancement
por: Du, Jun, et al.
Publicado: (2025)
por: Du, Jun, et al.
Publicado: (2025)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
por: Li, Hongxin, et al.
Publicado: (2026)
por: Li, Hongxin, et al.
Publicado: (2026)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
por: Ge, Zhiqi, et al.
Publicado: (2024)
por: Ge, Zhiqi, et al.
Publicado: (2024)
Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
por: Liao, Haicheng, et al.
Publicado: (2025)
por: Liao, Haicheng, et al.
Publicado: (2025)
Ejemplares similares
-
How Auxiliary Reasoning Unleashes GUI Grounding in VLMs
por: Li, Weiming, et al.
Publicado: (2025) -
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
por: Guo, Chaohong, et al.
Publicado: (2025) -
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
por: Li, Hongxin, et al.
Publicado: (2025) -
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
por: Guo, Hao, et al.
Publicado: (2026) -
POINTS-GUI-G: GUI-Grounding Journey
por: Zhao, Zhongyin, et al.
Publicado: (2026)