Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ernhofer, Benjamin Raphael, Prokhorov, Daniil, Langner, Jannica, Bollmann, Dominik |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
par: Hsieh, ZongHan, et autres
Publié: (2025)
par: Hsieh, ZongHan, et autres
Publié: (2025)
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
par: Baechler, Gilles, et autres
Publié: (2024)
par: Baechler, Gilles, et autres
Publié: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
par: Ouyang, Mingyu, et autres
Publié: (2026)
par: Ouyang, Mingyu, et autres
Publié: (2026)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
par: Maeda, Koki, et autres
Publié: (2024)
par: Maeda, Koki, et autres
Publié: (2024)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
par: Wang, Jingyi, et autres
Publié: (2024)
par: Wang, Jingyi, et autres
Publié: (2024)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Towards Understanding Visual Grounding in Visual Language Models
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
par: Yan, Siming, et autres
Publié: (2024)
par: Yan, Siming, et autres
Publié: (2024)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
par: Rahman, Md Ashikur, et autres
Publié: (2026)
par: Rahman, Md Ashikur, et autres
Publié: (2026)
Leveraging Vision-Language Models to Detect Attention in Educational Videos
par: Becquet, Gabriel, et autres
Publié: (2026)
par: Becquet, Gabriel, et autres
Publié: (2026)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
par: Chen, Boyuan, et autres
Publié: (2026)
par: Chen, Boyuan, et autres
Publié: (2026)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
par: Felizzi, Federico, et autres
Publié: (2025)
par: Felizzi, Federico, et autres
Publié: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
par: Aranya, OFM Riaz Rahman, et autres
Publié: (2026)
par: Aranya, OFM Riaz Rahman, et autres
Publié: (2026)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
par: Yu, Keunwoo Peter, et autres
Publié: (2025)
par: Yu, Keunwoo Peter, et autres
Publié: (2025)
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
par: Ha, Jiwoo, et autres
Publié: (2026)
par: Ha, Jiwoo, et autres
Publié: (2026)
Predicting and Explaining Mobile UI Tappability with Vision Modeling and Saliency Analysis
par: Schoop, Eldon, et autres
Publié: (2022)
par: Schoop, Eldon, et autres
Publié: (2022)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
Skill-Conditioned Visual Geolocation for Vision-Language Models
par: Yang, Chenjie, et autres
Publié: (2026)
par: Yang, Chenjie, et autres
Publié: (2026)
Generative Visual Communication in the Era of Vision-Language Models
par: Vinker, Yael
Publié: (2024)
par: Vinker, Yael
Publié: (2024)
Physically Grounded Vision-Language Models for Robotic Manipulation
par: Gao, Jensen, et autres
Publié: (2023)
par: Gao, Jensen, et autres
Publié: (2023)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
par: Zhou, Lijie
Publié: (2026)
par: Zhou, Lijie
Publié: (2026)
3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models
par: Sambara, Sraavya, et autres
Publié: (2025)
par: Sambara, Sraavya, et autres
Publié: (2025)
Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models
par: Samin, Niamul Hassan, et autres
Publié: (2026)
par: Samin, Niamul Hassan, et autres
Publié: (2026)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
par: Chae, Hyunsik, et autres
Publié: (2025)
par: Chae, Hyunsik, et autres
Publié: (2025)
Leveraging Vision-Language Models to Select Trustworthy Super-Resolution Samples Generated by Diffusion Models
par: Korkmaz, Cansu, et autres
Publié: (2025)
par: Korkmaz, Cansu, et autres
Publié: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
par: Wang, Jingchao, et autres
Publié: (2025)
par: Wang, Jingchao, et autres
Publié: (2025)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
par: Xiao, Zhendong, et autres
Publié: (2025)
par: Xiao, Zhendong, et autres
Publié: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
par: Shalabi, Fatma, et autres
Publié: (2024)
par: Shalabi, Fatma, et autres
Publié: (2024)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
par: Ong, Kenneth J. K.
Publié: (2026)
par: Ong, Kenneth J. K.
Publié: (2026)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
par: Dai, Muzhi, et autres
Publié: (2025)
par: Dai, Muzhi, et autres
Publié: (2025)
Documents similaires
-
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
par: Hsieh, ZongHan, et autres
Publié: (2025) -
ScreenAI: A Vision-Language Model for UI and Infographics Understanding
par: Baechler, Gilles, et autres
Publié: (2024) -
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024) -
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
par: Ouyang, Mingyu, et autres
Publié: (2026) -
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
par: Maeda, Koki, et autres
Publié: (2024)