The Spatial Blindspot of Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Alam, Nahid, Murali, Leema Krishna, Bharadwaj, Siddhant, Liu, Patrick, Chung, Timothy, Sharma, Drishti, A, Akshata, Kiran, Kranthi, Tam, Wesley, Vegesna, Bala Krishna S |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
par: Alam, Nahid, et autres
Publié: (2026)
par: Alam, Nahid, et autres
Publié: (2026)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
par: Zafar, Anas, et autres
Publié: (2026)
par: Zafar, Anas, et autres
Publié: (2026)
Behind Maya: Building a Multilingual Vision Language Model
par: Alam, Nahid, et autres
Publié: (2025)
par: Alam, Nahid, et autres
Publié: (2025)
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)
Maya: An Instruction Finetuned Multilingual Multimodal Model
par: Alam, Nahid, et autres
Publié: (2024)
par: Alam, Nahid, et autres
Publié: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
par: Zhou, Yuchen, et autres
Publié: (2025)
par: Zhou, Yuchen, et autres
Publié: (2025)
Adaptive Multi Scale Document Binarisation Using Vision Mamba
par: Azfar, Mohd., et autres
Publié: (2024)
par: Azfar, Mohd., et autres
Publié: (2024)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
Causal Physics Steering in Video World Models via Concept Activation Vectors
par: Alam, Nahid
Publié: (2026)
par: Alam, Nahid
Publié: (2026)
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
par: Yuan, Wentao, et autres
Publié: (2024)
par: Yuan, Wentao, et autres
Publié: (2024)
Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping
par: Vegesna, Nitin, et autres
Publié: (2026)
par: Vegesna, Nitin, et autres
Publié: (2026)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
par: Zhang, Tianyi, et autres
Publié: (2026)
par: Zhang, Tianyi, et autres
Publié: (2026)
Iterated Learning Improves Compositionality in Large Vision-Language Models
par: Zheng, Chenhao, et autres
Publié: (2024)
par: Zheng, Chenhao, et autres
Publié: (2024)
Embedding Geometries of Contrastive Language-Image Pre-Training
par: Chou, Jason Chuan-Chih, et autres
Publié: (2024)
par: Chou, Jason Chuan-Chih, et autres
Publié: (2024)
Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics
par: Roy, Subhadeep, et autres
Publié: (2026)
par: Roy, Subhadeep, et autres
Publié: (2026)
Enhancing Vision Language Models with Logic Reasoning for Situational Awareness
par: Pradeep, Pavana, et autres
Publié: (2026)
par: Pradeep, Pavana, et autres
Publié: (2026)
The Nonverbal Gap: Toward Affective Computer Vision for Safer and More Equitable Online Dating
par: Kandala, Ratna, et autres
Publié: (2026)
par: Kandala, Ratna, et autres
Publié: (2026)
PRECISe : Prototype-Reservation for Explainable Classification under Imbalanced and Scarce-Data Settings
par: Ganatra, Vaibhav, et autres
Publié: (2024)
par: Ganatra, Vaibhav, et autres
Publié: (2024)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
par: Lim, Gyubeum, et autres
Publié: (2025)
par: Lim, Gyubeum, et autres
Publié: (2025)
From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?
par: Nakka, Krishna Kanth, et autres
Publié: (2026)
par: Nakka, Krishna Kanth, et autres
Publié: (2026)
Mechanisms of Non-Monotonic Scaling in Vision Transformers
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
The Hard Positive Truth about Vision-Language Compositionality
par: Kamath, Amita, et autres
Publié: (2024)
par: Kamath, Amita, et autres
Publié: (2024)
Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid
par: Sharma, Krishna Kumar, et autres
Publié: (2026)
par: Sharma, Krishna Kumar, et autres
Publié: (2026)
Watermarking in Diffusion Model: Gaussian Shading with Exact Diffusion Inversion via Coupled Transformations (EDICT)
par: Panthi, Krishna
Publié: (2025)
par: Panthi, Krishna
Publié: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
par: Bohacek, Matyas, et autres
Publié: (2025)
par: Bohacek, Matyas, et autres
Publié: (2025)
VLS: Steering Pretrained Robot Policies via Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2026)
par: Liu, Shuo, et autres
Publié: (2026)
Dynamic Contextual Attention Network: Transforming Spatial Representations into Adaptive Insights for Endoscopic Polyp Diagnosis
par: Cherukuri, Teja Krishna, et autres
Publié: (2025)
par: Cherukuri, Teja Krishna, et autres
Publié: (2025)
Fill in the ____ (a Diffusion-based Image Inpainting Pipeline)
par: Gebre, Eyoel, et autres
Publié: (2024)
par: Gebre, Eyoel, et autres
Publié: (2024)
MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives
par: Ikezogwo, Wisdom O., et autres
Publié: (2025)
par: Ikezogwo, Wisdom O., et autres
Publié: (2025)
Parameter Reduction Improves Vision Transformers: A Comparative Study of Sharing and Width Reduction
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
SPACE: 3D Spatial Co-operation and Exploration Framework for Robust Mapping and Coverage with Multi-Robot Systems
par: Ghanta, Sai Krishna, et autres
Publié: (2024)
par: Ghanta, Sai Krishna, et autres
Publié: (2024)
MRI Volume-Based Robust Brain Age Estimation Using Weight-Shared Spatial Attention in 3D CNNs
par: Kancharla, Vamshi Krishna, et autres
Publié: (2024)
par: Kancharla, Vamshi Krishna, et autres
Publié: (2024)
Mammo-SAE: Interpreting Breast Cancer Concept Learning with Sparse Autoencoders
par: Nakka, Krishna Kanth
Publié: (2025)
par: Nakka, Krishna Kanth
Publié: (2025)
YoChameleon: Personalized Vision and Language Generation
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
HOI-Ref: Hand-Object Interaction Referral in Egocentric Vision
par: Bansal, Siddhant, et autres
Publié: (2024)
par: Bansal, Siddhant, et autres
Publié: (2024)
CanViT: Toward Active-Vision Foundation Models
par: Berreby, Yohaï-Eliel, et autres
Publié: (2026)
par: Berreby, Yohaï-Eliel, et autres
Publié: (2026)
Optimizing Latent Graph Representations of Surgical Scenes for Zero-Shot Domain Transfer
par: Satyanaik, Siddhant, et autres
Publié: (2024)
par: Satyanaik, Siddhant, et autres
Publié: (2024)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
par: Su, Xia, et autres
Publié: (2026)
par: Su, Xia, et autres
Publié: (2026)
Documents similaires
-
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
par: Alam, Nahid, et autres
Publié: (2026) -
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
par: Zafar, Anas, et autres
Publié: (2026) -
Behind Maya: Building a Multilingual Vision Language Model
par: Alam, Nahid, et autres
Publié: (2025) -
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025) -
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
par: Chitty-Venkata, Krishna Teja, et autres
Publié: (2025)