Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
Fuente:
arXiv
Guardado en:
| Autor principal: | Levental, Yuval |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026)
por: Cui, Kelly, et al.
Publicado: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024)
por: Chen, Boyuan, et al.
Publicado: (2024)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
por: Xie, Yuechen, et al.
Publicado: (2026)
por: Xie, Yuechen, et al.
Publicado: (2026)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
por: Wasi, Azmine Toushik, et al.
Publicado: (2026)
por: Wasi, Azmine Toushik, et al.
Publicado: (2026)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
por: Zhao, Yanpeng, et al.
Publicado: (2026)
por: Zhao, Yanpeng, et al.
Publicado: (2026)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)
por: Rajabi, Navid, et al.
Publicado: (2023)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
por: Li, Chengzu, et al.
Publicado: (2024)
por: Li, Chengzu, et al.
Publicado: (2024)
Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models
por: Dumpala, Sri Harsha, et al.
Publicado: (2024)
por: Dumpala, Sri Harsha, et al.
Publicado: (2024)
Simple Vision-Language Math Reasoning via Rendered Text
por: Skripkin, Matvey, et al.
Publicado: (2025)
por: Skripkin, Matvey, et al.
Publicado: (2025)
VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text
por: Zhang, Tianyu, et al.
Publicado: (2024)
por: Zhang, Tianyu, et al.
Publicado: (2024)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
por: Góral, Gracjan, et al.
Publicado: (2024)
por: Góral, Gracjan, et al.
Publicado: (2024)
Spatial Reasoning with Denoising Models
por: Wewer, Christopher, et al.
Publicado: (2025)
por: Wewer, Christopher, et al.
Publicado: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception
por: Waite, Joshua R., et al.
Publicado: (2025)
por: Waite, Joshua R., et al.
Publicado: (2025)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
por: Liu, Benlin, et al.
Publicado: (2024)
por: Liu, Benlin, et al.
Publicado: (2024)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
por: Chakraborty, Trishna, et al.
Publicado: (2026)
por: Chakraborty, Trishna, et al.
Publicado: (2026)
Efficient Domain Adaptation for Text Line Recognition via Decoupled Language Models
por: Dev, Arundhathi, et al.
Publicado: (2026)
por: Dev, Arundhathi, et al.
Publicado: (2026)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
por: Berasi, Davide, et al.
Publicado: (2025)
por: Berasi, Davide, et al.
Publicado: (2025)
EasyARC: Evaluating Vision Language Models on True Visual Reasoning
por: Unsal, Mert, et al.
Publicado: (2025)
por: Unsal, Mert, et al.
Publicado: (2025)
Text-to-Scene with Large Reasoning Models
por: Berdoz, Frédéric, et al.
Publicado: (2025)
por: Berdoz, Frédéric, et al.
Publicado: (2025)
ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
por: Li, Zhaoyang, et al.
Publicado: (2025)
por: Li, Zhaoyang, et al.
Publicado: (2025)
Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning
por: Harmanani, Mohamed, et al.
Publicado: (2026)
por: Harmanani, Mohamed, et al.
Publicado: (2026)
Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
por: You, Weiqiu, et al.
Publicado: (2026)
por: You, Weiqiu, et al.
Publicado: (2026)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
por: Li, Ling, et al.
Publicado: (2024)
por: Li, Ling, et al.
Publicado: (2024)
Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
por: Shandilya, Utkarsh, et al.
Publicado: (2025)
por: Shandilya, Utkarsh, et al.
Publicado: (2025)
FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
por: Huang, Chenyu, et al.
Publicado: (2026)
por: Huang, Chenyu, et al.
Publicado: (2026)
LongProLIP: A Probabilistic Vision-Language Model with Long Context Text
por: Chun, Sanghyuk, et al.
Publicado: (2025)
por: Chun, Sanghyuk, et al.
Publicado: (2025)
Vision-Language Models Can't See the Obvious
por: Dahou, Yasser, et al.
Publicado: (2025)
por: Dahou, Yasser, et al.
Publicado: (2025)
CAM-Based Methods Can See through Walls
por: Taimeskhanov, Magamed, et al.
Publicado: (2024)
por: Taimeskhanov, Magamed, et al.
Publicado: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
por: Ross, Candace, et al.
Publicado: (2025)
por: Ross, Candace, et al.
Publicado: (2025)
Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?
por: Yang, Yiwei, et al.
Publicado: (2025)
por: Yang, Yiwei, et al.
Publicado: (2025)
Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance
por: Liu, Hui, et al.
Publicado: (2025)
por: Liu, Hui, et al.
Publicado: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
por: Li, Sijie, et al.
Publicado: (2026)
por: Li, Sijie, et al.
Publicado: (2026)
VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
por: Bi, Tianci, et al.
Publicado: (2025)
por: Bi, Tianci, et al.
Publicado: (2025)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
por: Huang, Xin, et al.
Publicado: (2025)
por: Huang, Xin, et al.
Publicado: (2025)
Ejemplares similares
-
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026) -
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024) -
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
por: Xie, Yuechen, et al.
Publicado: (2026) -
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025) -
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
por: Wasi, Azmine Toushik, et al.
Publicado: (2026)