SPHERE: Unveiling Spatial Blind Spots in Vision-Language Models Through Hierarchical Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Wenyu, Ng, Wei En, Ma, Lixin, Wang, Yuwen, Zhao, Junqi, Koenecke, Allison, Li, Boyang, Wang, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases
por: Tiong, Anthony Meng Huat, et al.
Publicado: (2024)
por: Tiong, Anthony Meng Huat, et al.
Publicado: (2024)
Unveiling Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models
por: Mao, Runhao, et al.
Publicado: (2026)
por: Mao, Runhao, et al.
Publicado: (2026)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
Blind Spot Navigation: Evolutionary Discovery of Sensitive Semantic Concepts for LVLMs
por: Pan, Zihao, et al.
Publicado: (2025)
por: Pan, Zihao, et al.
Publicado: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
On the Difficulty of Learning a Meta-network for Training Data Selection
por: Du, Zilin, et al.
Publicado: (2026)
por: Du, Zilin, et al.
Publicado: (2026)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
por: Lee, Jonathan, et al.
Publicado: (2025)
por: Lee, Jonathan, et al.
Publicado: (2025)
Adaptive Multi-modal Fusion of Spatially Variant Kernel Refinement with Diffusion Model for Blind Image Super-Resolution
por: Lin, Junxiong, et al.
Publicado: (2024)
por: Lin, Junxiong, et al.
Publicado: (2024)
Hierarchical Vision-Language Learning for Medical Out-of-Distribution Detection
por: Lai, Runhe, et al.
Publicado: (2025)
por: Lai, Runhe, et al.
Publicado: (2025)
Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models
por: Liu, Zuyan, et al.
Publicado: (2024)
por: Liu, Zuyan, et al.
Publicado: (2024)
Spatiotemporal Blind-Spot Network with Calibrated Flow Alignment for Self-Supervised Video Denoising
por: Chen, Zikang, et al.
Publicado: (2024)
por: Chen, Zikang, et al.
Publicado: (2024)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
por: Wang, Yiru, et al.
Publicado: (2026)
por: Wang, Yiru, et al.
Publicado: (2026)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
por: Liang, Huizhi, et al.
Publicado: (2026)
por: Liang, Huizhi, et al.
Publicado: (2026)
Blind Deconvolution for Color Images Using Normalized Quaternion Kernels
por: Yang, Yuming, et al.
Publicado: (2025)
por: Yang, Yuming, et al.
Publicado: (2025)
Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data
por: Li, Haoxin, et al.
Publicado: (2025)
por: Li, Haoxin, et al.
Publicado: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
Sketch2MinSurf: Vision-Language Guided Generation of Editable Minimal Surfaces from Hand-Drawn Sketches
por: Wang, Wenda, et al.
Publicado: (2026)
por: Wang, Wenda, et al.
Publicado: (2026)
DVLTA-VQA: Decoupled Vision-Language Modeling with Text-Guided Adaptation for Blind Video Quality Assessment
por: Yu, Li, et al.
Publicado: (2025)
por: Yu, Li, et al.
Publicado: (2025)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
por: Li, Yingyue, et al.
Publicado: (2025)
por: Li, Yingyue, et al.
Publicado: (2025)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
por: Li, Dingming, et al.
Publicado: (2025)
por: Li, Dingming, et al.
Publicado: (2025)
Hierarchical GraphCut Phase Unwrapping based on Invariance of Diffeomorphisms Framework
por: Gao, Xiang, et al.
Publicado: (2025)
por: Gao, Xiang, et al.
Publicado: (2025)
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
por: Wang, Jiayun, et al.
Publicado: (2026)
por: Wang, Jiayun, et al.
Publicado: (2026)
HiFusion: Hierarchical Intra-Spot Alignment and Regional Context Fusion for Spatial Gene Expression Prediction from Histopathology
por: Weng, Ziqiao, et al.
Publicado: (2025)
por: Weng, Ziqiao, et al.
Publicado: (2025)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
por: Tan, Yuwen, et al.
Publicado: (2025)
por: Tan, Yuwen, et al.
Publicado: (2025)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
por: Jia, Hongrui, et al.
Publicado: (2026)
por: Jia, Hongrui, et al.
Publicado: (2026)
CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
Into the Unknown: Accounting for Missing Demographic Data when Mitigating Ad Delivery Skew
por: Corpus, Isabel, et al.
Publicado: (2026)
por: Corpus, Isabel, et al.
Publicado: (2026)
Deep Generative Models Unveil Patterns in Medical Images Through Vision-Language Conditioning
por: Xing, Xiaodan, et al.
Publicado: (2024)
por: Xing, Xiaodan, et al.
Publicado: (2024)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
por: Wang, Anmin, et al.
Publicado: (2026)
por: Wang, Anmin, et al.
Publicado: (2026)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Point or Line? Using Line-based Representation for Panoptic Symbol Spotting in CAD Drawings
por: Wei, Xingguang, et al.
Publicado: (2025)
por: Wei, Xingguang, et al.
Publicado: (2025)
Multimodal Language Models Cannot Spot Spatial Inconsistencies
por: Khangaonkar, Om, et al.
Publicado: (2026)
por: Khangaonkar, Om, et al.
Publicado: (2026)
Vision-Language Memory for Spatial Reasoning
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium
por: Xiao, Qingxin, et al.
Publicado: (2026)
por: Xiao, Qingxin, et al.
Publicado: (2026)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
por: Pang, Xingzhou, et al.
Publicado: (2026)
por: Pang, Xingzhou, et al.
Publicado: (2026)
Suppressing Uncertainties in Degradation Estimation for Blind Super-Resolution
por: Lin, Junxiong, et al.
Publicado: (2024)
por: Lin, Junxiong, et al.
Publicado: (2024)
Ejemplares similares
-
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026) -
What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases
por: Tiong, Anthony Meng Huat, et al.
Publicado: (2024) -
Unveiling Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2024) -
The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models
por: Mao, Runhao, et al.
Publicado: (2026) -
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
por: Zhang, Jie, et al.
Publicado: (2025)