R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Park, Joonhyung, Tang, Peng, Das, Sagnik, Appalaraju, Srikar, Singh, Kunwar Yashraj, Manmatha, R., Ghadar, Shabnam |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
von: Kumbhar, Shrinidhi, et al.
Veröffentlicht: (2026)
von: Kumbhar, Shrinidhi, et al.
Veröffentlicht: (2026)
Enhancing Vision-Language Pre-training with Rich Supervisions
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA
von: Li, Zhuowan, et al.
Veröffentlicht: (2024)
von: Li, Zhuowan, et al.
Veröffentlicht: (2024)
VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document Understanding
von: Abramovich, Ofir, et al.
Veröffentlicht: (2024)
von: Abramovich, Ofir, et al.
Veröffentlicht: (2024)
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
von: Kim, Sungnyun, et al.
Veröffentlicht: (2024)
von: Kim, Sungnyun, et al.
Veröffentlicht: (2024)
RAVEN: Multitask Retrieval Augmented Vision-Language Learning
von: Rao, Varun Nagaraj, et al.
Veröffentlicht: (2024)
von: Rao, Varun Nagaraj, et al.
Veröffentlicht: (2024)
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
von: Kim, Joowon, et al.
Veröffentlicht: (2026)
von: Kim, Joowon, et al.
Veröffentlicht: (2026)
TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents
von: Singh, Kunal, et al.
Veröffentlicht: (2025)
von: Singh, Kunal, et al.
Veröffentlicht: (2025)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
von: Kim, Sohee, et al.
Veröffentlicht: (2025)
von: Kim, Sohee, et al.
Veröffentlicht: (2025)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
von: Ye, Xianhang, et al.
Veröffentlicht: (2025)
von: Ye, Xianhang, et al.
Veröffentlicht: (2025)
GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning
von: Li, Junlong, et al.
Veröffentlicht: (2026)
von: Li, Junlong, et al.
Veröffentlicht: (2026)
POINTS-GUI-G: GUI-Grounding Journey
von: Zhao, Zhongyin, et al.
Veröffentlicht: (2026)
von: Zhao, Zhongyin, et al.
Veröffentlicht: (2026)
Language-Grounded Multi-Domain Image Translation via Semantic Difference Guidance
von: Ryu, Jongwon, et al.
Veröffentlicht: (2026)
von: Ryu, Jongwon, et al.
Veröffentlicht: (2026)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
von: Du, Yong, et al.
Veröffentlicht: (2025)
von: Du, Yong, et al.
Veröffentlicht: (2025)
AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding
von: Yao, Ruilin, et al.
Veröffentlicht: (2026)
von: Yao, Ruilin, et al.
Veröffentlicht: (2026)
Bi-VLM: Pushing Ultra-Low Precision Post-Training Quantization Boundaries in Vision-Language Models
von: Wang, Xijun, et al.
Veröffentlicht: (2025)
von: Wang, Xijun, et al.
Veröffentlicht: (2025)
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
von: Luo, Run, et al.
Veröffentlicht: (2025)
von: Luo, Run, et al.
Veröffentlicht: (2025)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
von: Shen, Haozhan, et al.
Veröffentlicht: (2025)
von: Shen, Haozhan, et al.
Veröffentlicht: (2025)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
von: Liu, Jiaxing, et al.
Veröffentlicht: (2026)
von: Liu, Jiaxing, et al.
Veröffentlicht: (2026)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
von: Sun, Xiaowen, et al.
Veröffentlicht: (2026)
von: Sun, Xiaowen, et al.
Veröffentlicht: (2026)
MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI
von: Shakeel, Rozain, et al.
Veröffentlicht: (2026)
von: Shakeel, Rozain, et al.
Veröffentlicht: (2026)
Q-VLM: Post-training Quantization for Large Vision-Language Models
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
von: Wang, Changyuan, et al.
Veröffentlicht: (2024)
AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement
von: Pei, Siqi, et al.
Veröffentlicht: (2026)
von: Pei, Siqi, et al.
Veröffentlicht: (2026)
V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM
von: Rahman, Abdur, et al.
Veröffentlicht: (2024)
von: Rahman, Abdur, et al.
Veröffentlicht: (2024)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
von: Kang, Donggoo, et al.
Veröffentlicht: (2024)
von: Kang, Donggoo, et al.
Veröffentlicht: (2024)
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
von: Hsieh, ZongHan, et al.
Veröffentlicht: (2025)
von: Hsieh, ZongHan, et al.
Veröffentlicht: (2025)
AutoGUI: Scaling GUI Grounding with Automatic Functionality Annotations from LLMs
von: Li, Hongxin, et al.
Veröffentlicht: (2025)
von: Li, Hongxin, et al.
Veröffentlicht: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Tian, Xiaoyu, et al.
Veröffentlicht: (2024)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
von: Wu, Qianhui, et al.
Veröffentlicht: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
von: Zhou, Yuqi, et al.
Veröffentlicht: (2025)
von: Zhou, Yuqi, et al.
Veröffentlicht: (2025)
BAMI: Training-Free Bias Mitigation in GUI Grounding
von: Zhang, Borui, et al.
Veröffentlicht: (2026)
von: Zhang, Borui, et al.
Veröffentlicht: (2026)
EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering
von: Dou, Zhifei, et al.
Veröffentlicht: (2026)
von: Dou, Zhifei, et al.
Veröffentlicht: (2026)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
von: Tian, Yu, et al.
Veröffentlicht: (2024)
von: Tian, Yu, et al.
Veröffentlicht: (2024)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
von: Deng, Guifeng, et al.
Veröffentlicht: (2026)
von: Deng, Guifeng, et al.
Veröffentlicht: (2026)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
von: Ji, Yatai, et al.
Veröffentlicht: (2024)
von: Ji, Yatai, et al.
Veröffentlicht: (2024)
DWaste: Greener AI for Waste Sorting using Mobile and Edge Devices
von: Kunwar, Suman
Veröffentlicht: (2025)
von: Kunwar, Suman
Veröffentlicht: (2025)
The Garbage Dataset (GD): A Multi-Class Image Benchmark for Automated Waste Segregation
von: Kunwar, Suman
Veröffentlicht: (2026)
von: Kunwar, Suman
Veröffentlicht: (2026)
Ähnliche Einträge
-
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
von: Kumbhar, Shrinidhi, et al.
Veröffentlicht: (2026) -
Enhancing Vision-Language Pre-training with Rich Supervisions
von: Gao, Yuan, et al.
Veröffentlicht: (2024) -
Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA
von: Li, Zhuowan, et al.
Veröffentlicht: (2024) -
VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document Understanding
von: Abramovich, Ofir, et al.
Veröffentlicht: (2024) -
DocKD: Knowledge Distillation from LLMs for Open-World Document Understanding Models
von: Kim, Sungnyun, et al.
Veröffentlicht: (2024)