The Spatial Blindspot of Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Alam, Nahid, Murali, Leema Krishna, Bharadwaj, Siddhant, Liu, Patrick, Chung, Timothy, Sharma, Drishti, A, Akshata, Kiran, Kranthi, Tam, Wesley, Vegesna, Bala Krishna S |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
por: Alam, Nahid, et al.
Publicado: (2026)
por: Alam, Nahid, et al.
Publicado: (2026)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
por: Zafar, Anas, et al.
Publicado: (2026)
por: Zafar, Anas, et al.
Publicado: (2026)
Behind Maya: Building a Multilingual Vision Language Model
por: Alam, Nahid, et al.
Publicado: (2025)
por: Alam, Nahid, et al.
Publicado: (2025)
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
Maya: An Instruction Finetuned Multilingual Multimodal Model
por: Alam, Nahid, et al.
Publicado: (2024)
por: Alam, Nahid, et al.
Publicado: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
por: Zhou, Yuchen, et al.
Publicado: (2025)
por: Zhou, Yuchen, et al.
Publicado: (2025)
Adaptive Multi Scale Document Binarisation Using Vision Mamba
por: Azfar, Mohd., et al.
Publicado: (2024)
por: Azfar, Mohd., et al.
Publicado: (2024)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
Causal Physics Steering in Video World Models via Concept Activation Vectors
por: Alam, Nahid
Publicado: (2026)
por: Alam, Nahid
Publicado: (2026)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
por: Yuan, Wentao, et al.
Publicado: (2024)
por: Yuan, Wentao, et al.
Publicado: (2024)
Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping
por: Vegesna, Nitin, et al.
Publicado: (2026)
por: Vegesna, Nitin, et al.
Publicado: (2026)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
por: Zhang, Tianyi, et al.
Publicado: (2026)
por: Zhang, Tianyi, et al.
Publicado: (2026)
Iterated Learning Improves Compositionality in Large Vision-Language Models
por: Zheng, Chenhao, et al.
Publicado: (2024)
por: Zheng, Chenhao, et al.
Publicado: (2024)
Embedding Geometries of Contrastive Language-Image Pre-Training
por: Chou, Jason Chuan-Chih, et al.
Publicado: (2024)
por: Chou, Jason Chuan-Chih, et al.
Publicado: (2024)
Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics
por: Roy, Subhadeep, et al.
Publicado: (2026)
por: Roy, Subhadeep, et al.
Publicado: (2026)
Enhancing Vision Language Models with Logic Reasoning for Situational Awareness
por: Pradeep, Pavana, et al.
Publicado: (2026)
por: Pradeep, Pavana, et al.
Publicado: (2026)
The Nonverbal Gap: Toward Affective Computer Vision for Safer and More Equitable Online Dating
por: Kandala, Ratna, et al.
Publicado: (2026)
por: Kandala, Ratna, et al.
Publicado: (2026)
PRECISe : Prototype-Reservation for Explainable Classification under Imbalanced and Scarce-Data Settings
por: Ganatra, Vaibhav, et al.
Publicado: (2024)
por: Ganatra, Vaibhav, et al.
Publicado: (2024)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
por: Lim, Gyubeum, et al.
Publicado: (2025)
por: Lim, Gyubeum, et al.
Publicado: (2025)
From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?
por: Nakka, Krishna Kanth, et al.
Publicado: (2026)
por: Nakka, Krishna Kanth, et al.
Publicado: (2026)
Mechanisms of Non-Monotonic Scaling in Vision Transformers
por: Kumar, Anantha Padmanaban Krishna
Publicado: (2025)
por: Kumar, Anantha Padmanaban Krishna
Publicado: (2025)
The Hard Positive Truth about Vision-Language Compositionality
por: Kamath, Amita, et al.
Publicado: (2024)
por: Kamath, Amita, et al.
Publicado: (2024)
Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid
por: Sharma, Krishna Kumar, et al.
Publicado: (2026)
por: Sharma, Krishna Kumar, et al.
Publicado: (2026)
Watermarking in Diffusion Model: Gaussian Shading with Exact Diffusion Inversion via Coupled Transformations (EDICT)
por: Panthi, Krishna
Publicado: (2025)
por: Panthi, Krishna
Publicado: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
por: Bohacek, Matyas, et al.
Publicado: (2025)
por: Bohacek, Matyas, et al.
Publicado: (2025)
VLS: Steering Pretrained Robot Policies via Vision-Language Models
por: Liu, Shuo, et al.
Publicado: (2026)
por: Liu, Shuo, et al.
Publicado: (2026)
Dynamic Contextual Attention Network: Transforming Spatial Representations into Adaptive Insights for Endoscopic Polyp Diagnosis
por: Cherukuri, Teja Krishna, et al.
Publicado: (2025)
por: Cherukuri, Teja Krishna, et al.
Publicado: (2025)
Fill in the ____ (a Diffusion-based Image Inpainting Pipeline)
por: Gebre, Eyoel, et al.
Publicado: (2024)
por: Gebre, Eyoel, et al.
Publicado: (2024)
MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives
por: Ikezogwo, Wisdom O., et al.
Publicado: (2025)
por: Ikezogwo, Wisdom O., et al.
Publicado: (2025)
Parameter Reduction Improves Vision Transformers: A Comparative Study of Sharing and Width Reduction
por: Kumar, Anantha Padmanaban Krishna
Publicado: (2025)
por: Kumar, Anantha Padmanaban Krishna
Publicado: (2025)
SPACE: 3D Spatial Co-operation and Exploration Framework for Robust Mapping and Coverage with Multi-Robot Systems
por: Ghanta, Sai Krishna, et al.
Publicado: (2024)
por: Ghanta, Sai Krishna, et al.
Publicado: (2024)
MRI Volume-Based Robust Brain Age Estimation Using Weight-Shared Spatial Attention in 3D CNNs
por: Kancharla, Vamshi Krishna, et al.
Publicado: (2024)
por: Kancharla, Vamshi Krishna, et al.
Publicado: (2024)
Mammo-SAE: Interpreting Breast Cancer Concept Learning with Sparse Autoencoders
por: Nakka, Krishna Kanth
Publicado: (2025)
por: Nakka, Krishna Kanth
Publicado: (2025)
YoChameleon: Personalized Vision and Language Generation
por: Nguyen, Thao, et al.
Publicado: (2025)
por: Nguyen, Thao, et al.
Publicado: (2025)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
por: Bansal, Siddhant, et al.
Publicado: (2024)
por: Bansal, Siddhant, et al.
Publicado: (2024)
CanViT: Toward Active-Vision Foundation Models
por: Berreby, Yohaï-Eliel, et al.
Publicado: (2026)
por: Berreby, Yohaï-Eliel, et al.
Publicado: (2026)
Optimizing Latent Graph Representations of Surgical Scenes for Zero-Shot Domain Transfer
por: Satyanaik, Siddhant, et al.
Publicado: (2024)
por: Satyanaik, Siddhant, et al.
Publicado: (2024)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
por: Su, Xia, et al.
Publicado: (2026)
por: Su, Xia, et al.
Publicado: (2026)
Ejemplares similares
-
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
por: Alam, Nahid, et al.
Publicado: (2026) -
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
por: Zafar, Anas, et al.
Publicado: (2026) -
Behind Maya: Building a Multilingual Vision Language Model
por: Alam, Nahid, et al.
Publicado: (2025) -
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025) -
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)