Towards Understanding Visual Grounding in Visual Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pantazopoulos, Georgios, Özyiğit, Eda B. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
An Efficient Training Pipeline for Reasoning Graphical User Interface Agents
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
par: Pantazopoulos, Georgios, et autres
Publié: (2025)
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
par: Pantazopoulos, Georgios, et autres
Publié: (2024)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
par: Wang, Jingchao, et autres
Publié: (2025)
par: Wang, Jingchao, et autres
Publié: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
par: Zheng, Shurong, et autres
Publié: (2026)
par: Zheng, Shurong, et autres
Publié: (2026)
DOGR: Towards Versatile Visual Document Grounding and Referring
par: Zhou, Yinan, et autres
Publié: (2024)
par: Zhou, Yinan, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Visual Position Prompt for MLLM based Visual Grounding
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
Generating by Understanding: Neural Visual Generation with Logical Symbol Groundings
par: Peng, Yifei, et autres
Publié: (2023)
par: Peng, Yifei, et autres
Publié: (2023)
ChatBEV: A Visual Language Model that Understands BEV Maps
par: Xu, Qingyao, et autres
Publié: (2025)
par: Xu, Qingyao, et autres
Publié: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
par: Kim, Keuntae, et autres
Publié: (2026)
par: Kim, Keuntae, et autres
Publié: (2026)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
par: Lim, Byeonggeuk, et autres
Publié: (2026)
par: Lim, Byeonggeuk, et autres
Publié: (2026)
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
par: Fu, Rao, et autres
Publié: (2024)
par: Fu, Rao, et autres
Publié: (2024)
IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation
par: Huang, Jiacui, et autres
Publié: (2024)
par: Huang, Jiacui, et autres
Publié: (2024)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
par: He, Jinlong, et autres
Publié: (2024)
par: He, Jinlong, et autres
Publié: (2024)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
par: Tartaglini, Alexa R., et autres
Publié: (2025)
par: Tartaglini, Alexa R., et autres
Publié: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
par: Song, Python, et autres
Publié: (2025)
par: Song, Python, et autres
Publié: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
par: Zhang, Huaxiang, et autres
Publié: (2024)
par: Zhang, Huaxiang, et autres
Publié: (2024)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
par: Yan, Siming, et autres
Publié: (2024)
par: Yan, Siming, et autres
Publié: (2024)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
par: Zhao, Haoyu, et autres
Publié: (2024)
par: Zhao, Haoyu, et autres
Publié: (2024)
Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models
par: Nguyen-Truong, Hai, et autres
Publié: (2026)
par: Nguyen-Truong, Hai, et autres
Publié: (2026)
Towards Visual Text Design Transfer Across Languages
par: Choi, Yejin, et autres
Publié: (2024)
par: Choi, Yejin, et autres
Publié: (2024)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
par: Li, Wenqiao, et autres
Publié: (2025)
par: Li, Wenqiao, et autres
Publié: (2025)
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
par: Villa, Andrés, et autres
Publié: (2025)
par: Villa, Andrés, et autres
Publié: (2025)
Reasoning Matters for 3D Visual Grounding
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
par: Chen, Tao, et autres
Publié: (2026)
par: Chen, Tao, et autres
Publié: (2026)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
par: Guo, Grace, et autres
Publié: (2024)
par: Guo, Grace, et autres
Publié: (2024)
VGR: Visual Grounded Reasoning
par: Wang, Jiacong, et autres
Publié: (2025)
par: Wang, Jiacong, et autres
Publié: (2025)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
par: Wang, Haibo, et autres
Publié: (2026)
par: Wang, Haibo, et autres
Publié: (2026)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
par: Rahman, Md Ashikur, et autres
Publié: (2026)
par: Rahman, Md Ashikur, et autres
Publié: (2026)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
par: Pang, Cong, et autres
Publié: (2025)
par: Pang, Cong, et autres
Publié: (2025)
Survey on Hand Gesture Recognition from Visual Input
par: Linardakis, Manousos, et autres
Publié: (2025)
par: Linardakis, Manousos, et autres
Publié: (2025)
Documents similaires
-
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
An Efficient Training Pipeline for Reasoning Graphical User Interface Agents
par: Pantazopoulos, Georgios, et autres
Publié: (2025) -
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
par: Pantazopoulos, Georgios, et autres
Publié: (2024) -
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
par: Wang, Jingchao, et autres
Publié: (2025) -
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
par: Zheng, Shurong, et autres
Publié: (2026)