The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cui, Kelly, Prakash, Nikhil, Raina, Ayush, Bau, David, Torralba, Antonio, Shaham, Tamar Rott |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision-Language Binding in In-Context Image Generation
by: Ge, Chris, et al.
Published: (2026)
by: Ge, Chris, et al.
Published: (2026)
A Vision Check-up for Language Models
by: Sharma, Pratyusha, et al.
Published: (2024)
by: Sharma, Pratyusha, et al.
Published: (2024)
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
by: Prakash, Nikhil, et al.
Published: (2024)
by: Prakash, Nikhil, et al.
Published: (2024)
SketchAgent: Language-Driven Sequential Sketch Generation
by: Vinker, Yael, et al.
Published: (2024)
by: Vinker, Yael, et al.
Published: (2024)
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
by: Wasserman, Navve, et al.
Published: (2025)
by: Wasserman, Navve, et al.
Published: (2025)
Dataset Distillation for Pre-Trained Self-Supervised Vision Models
by: Cazenavette, George, et al.
Published: (2025)
by: Cazenavette, George, et al.
Published: (2025)
From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain
by: Golbari, Yuval, et al.
Published: (2026)
by: Golbari, Yuval, et al.
Published: (2026)
Automated Detection of Visual Attribute Reliance with a Self-Reflective Agent
by: Li, Christy, et al.
Published: (2025)
by: Li, Christy, et al.
Published: (2025)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
by: Xie, Yuechen, et al.
Published: (2026)
by: Xie, Yuechen, et al.
Published: (2026)
A Multimodal Automated Interpretability Agent
by: Shaham, Tamar Rott, et al.
Published: (2024)
by: Shaham, Tamar Rott, et al.
Published: (2024)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
by: Zhao, Yanpeng, et al.
Published: (2026)
by: Zhao, Yanpeng, et al.
Published: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
by: Chen, Boyuan, et al.
Published: (2024)
by: Chen, Boyuan, et al.
Published: (2024)
RealStats: A Rigorous Real-Only Statistical Framework for Fake Image Detection
by: Zisman, Haim, et al.
Published: (2026)
by: Zisman, Haim, et al.
Published: (2026)
Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
by: Levental, Yuval
Published: (2026)
by: Levental, Yuval
Published: (2026)
Logit Disagreement: OoD Detection with Bayesian Neural Networks
by: Raina, Kevin
Published: (2025)
by: Raina, Kevin
Published: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
by: Rajabi, Navid, et al.
Published: (2023)
by: Rajabi, Navid, et al.
Published: (2023)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
by: Li, Chengzu, et al.
Published: (2024)
by: Li, Chengzu, et al.
Published: (2024)
RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception
by: Waite, Joshua R., et al.
Published: (2025)
by: Waite, Joshua R., et al.
Published: (2025)
MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
by: Wang, Yuandong, et al.
Published: (2025)
by: Wang, Yuandong, et al.
Published: (2025)
Enhancing VICReg: Random-Walk Pairing for Improved Generalization and Better Global Semantics Capturing
by: Simai, Idan, et al.
Published: (2025)
by: Simai, Idan, et al.
Published: (2025)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
by: Liu, Benlin, et al.
Published: (2024)
by: Liu, Benlin, et al.
Published: (2024)
Spatial Reasoning with Denoising Models
by: Wewer, Christopher, et al.
Published: (2025)
by: Wewer, Christopher, et al.
Published: (2025)
Dual Prototype Evolving for Test-Time Generalization of Vision-Language Models
by: Zhang, Ce, et al.
Published: (2024)
by: Zhang, Ce, et al.
Published: (2024)
Unified Concept Editing in Diffusion Models
by: Gandikota, Rohit, et al.
Published: (2023)
by: Gandikota, Rohit, et al.
Published: (2023)
EasyARC: Evaluating Vision Language Models on True Visual Reasoning
by: Unsal, Mert, et al.
Published: (2025)
by: Unsal, Mert, et al.
Published: (2025)
Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
by: Ling, Huan, et al.
Published: (2023)
by: Ling, Huan, et al.
Published: (2023)
Behavioural Cloning in VizDoom
by: Spick, Ryan, et al.
Published: (2024)
by: Spick, Ryan, et al.
Published: (2024)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
by: Li, Ling, et al.
Published: (2024)
by: Li, Ling, et al.
Published: (2024)
ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery
by: Shrivastava, Ayush, et al.
Published: (2026)
by: Shrivastava, Ayush, et al.
Published: (2026)
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning
by: Harmanani, Mohamed, et al.
Published: (2026)
by: Harmanani, Mohamed, et al.
Published: (2026)
Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
by: You, Weiqiu, et al.
Published: (2026)
by: You, Weiqiu, et al.
Published: (2026)
HoneyBee: Data Recipes for Vision-Language Reasoners
by: Bansal, Hritik, et al.
Published: (2025)
by: Bansal, Hritik, et al.
Published: (2025)
Characterizing Model Robustness via Natural Input Gradients
by: Rodríguez-Muñoz, Adrián, et al.
Published: (2024)
by: Rodríguez-Muñoz, Adrián, et al.
Published: (2024)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
by: Jiang, Feng, et al.
Published: (2025)
by: Jiang, Feng, et al.
Published: (2025)
FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
by: Huang, Chenyu, et al.
Published: (2026)
by: Huang, Chenyu, et al.
Published: (2026)
Simple Vision-Language Math Reasoning via Rendered Text
by: Skripkin, Matvey, et al.
Published: (2025)
by: Skripkin, Matvey, et al.
Published: (2025)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
by: Huang, Xin, et al.
Published: (2025)
by: Huang, Xin, et al.
Published: (2025)
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
by: Chu, Xu, et al.
Published: (2025)
by: Chu, Xu, et al.
Published: (2025)
Learning Shared Representations from Unpaired Data
by: Yacobi, Amitai, et al.
Published: (2025)
by: Yacobi, Amitai, et al.
Published: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
by: Ding, Yi, et al.
Published: (2025)
by: Ding, Yi, et al.
Published: (2025)
Similar Items
-
Vision-Language Binding in In-Context Image Generation
by: Ge, Chris, et al.
Published: (2026) -
A Vision Check-up for Language Models
by: Sharma, Pratyusha, et al.
Published: (2024) -
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
by: Prakash, Nikhil, et al.
Published: (2024) -
SketchAgent: Language-Driven Sequential Sketch Generation
by: Vinker, Yael, et al.
Published: (2024) -
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
by: Wasserman, Navve, et al.
Published: (2025)