Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
Fuente:
arXiv
Guardado en:
| Autores principales: | Ernhofer, Benjamin Raphael, Prokhorov, Daniil, Langner, Jannica, Bollmann, Dominik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
por: Hsieh, ZongHan, et al.
Publicado: (2025)
por: Hsieh, ZongHan, et al.
Publicado: (2025)
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
por: Baechler, Gilles, et al.
Publicado: (2024)
por: Baechler, Gilles, et al.
Publicado: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
por: Ouyang, Mingyu, et al.
Publicado: (2026)
por: Ouyang, Mingyu, et al.
Publicado: (2026)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
por: Maeda, Koki, et al.
Publicado: (2024)
por: Maeda, Koki, et al.
Publicado: (2024)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
por: Nayak, Shravan, et al.
Publicado: (2025)
por: Nayak, Shravan, et al.
Publicado: (2025)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
por: Wang, Jingyi, et al.
Publicado: (2024)
por: Wang, Jingyi, et al.
Publicado: (2024)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
Towards Understanding Visual Grounding in Visual Language Models
por: Pantazopoulos, Georgios, et al.
Publicado: (2025)
por: Pantazopoulos, Georgios, et al.
Publicado: (2025)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
por: Chen, Liangyu, et al.
Publicado: (2025)
por: Chen, Liangyu, et al.
Publicado: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
por: Kang, Seil, et al.
Publicado: (2025)
por: Kang, Seil, et al.
Publicado: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2026)
por: Tang, Fei, et al.
Publicado: (2026)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
por: Wang, Haibo, et al.
Publicado: (2026)
por: Wang, Haibo, et al.
Publicado: (2026)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
por: Rahman, Md Ashikur, et al.
Publicado: (2026)
por: Rahman, Md Ashikur, et al.
Publicado: (2026)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
por: Becquet, Gabriel, et al.
Publicado: (2026)
por: Becquet, Gabriel, et al.
Publicado: (2026)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
por: Chen, Boyuan, et al.
Publicado: (2026)
por: Chen, Boyuan, et al.
Publicado: (2026)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
por: Felizzi, Federico, et al.
Publicado: (2025)
por: Felizzi, Federico, et al.
Publicado: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
por: Kumbhar, Shrinidhi, et al.
Publicado: (2026)
por: Kumbhar, Shrinidhi, et al.
Publicado: (2026)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
por: Aranya, OFM Riaz Rahman, et al.
Publicado: (2026)
por: Aranya, OFM Riaz Rahman, et al.
Publicado: (2026)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
por: Ha, Jiwoo, et al.
Publicado: (2026)
por: Ha, Jiwoo, et al.
Publicado: (2026)
Predicting and Explaining Mobile UI Tappability with Vision Modeling and Saliency Analysis
por: Schoop, Eldon, et al.
Publicado: (2022)
por: Schoop, Eldon, et al.
Publicado: (2022)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
Skill-Conditioned Visual Geolocation for Vision-Language Models
por: Yang, Chenjie, et al.
Publicado: (2026)
por: Yang, Chenjie, et al.
Publicado: (2026)
Generative Visual Communication in the Era of Vision-Language Models
por: Vinker, Yael
Publicado: (2024)
por: Vinker, Yael
Publicado: (2024)
Physically Grounded Vision-Language Models for Robotic Manipulation
por: Gao, Jensen, et al.
Publicado: (2023)
por: Gao, Jensen, et al.
Publicado: (2023)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
por: Zhou, Lijie
Publicado: (2026)
por: Zhou, Lijie
Publicado: (2026)
3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models
por: Sambara, Sraavya, et al.
Publicado: (2025)
por: Sambara, Sraavya, et al.
Publicado: (2025)
Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models
por: Samin, Niamul Hassan, et al.
Publicado: (2026)
por: Samin, Niamul Hassan, et al.
Publicado: (2026)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
por: Chae, Hyunsik, et al.
Publicado: (2025)
por: Chae, Hyunsik, et al.
Publicado: (2025)
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
por: Korkmaz, Cansu, et al.
Publicado: (2025)
por: Korkmaz, Cansu, et al.
Publicado: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
por: Wang, Jingchao, et al.
Publicado: (2025)
por: Wang, Jingchao, et al.
Publicado: (2025)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
por: Xiao, Zhendong, et al.
Publicado: (2025)
por: Xiao, Zhendong, et al.
Publicado: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
por: Shalabi, Fatma, et al.
Publicado: (2024)
por: Shalabi, Fatma, et al.
Publicado: (2024)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
por: Ong, Kenneth J. K.
Publicado: (2026)
por: Ong, Kenneth J. K.
Publicado: (2026)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
Ejemplares similares
-
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
por: Hsieh, ZongHan, et al.
Publicado: (2025) -
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
por: Baechler, Gilles, et al.
Publicado: (2024) -
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024) -
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
por: Ouyang, Mingyu, et al.
Publicado: (2026) -
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
por: Maeda, Koki, et al.
Publicado: (2024)