Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jiayu, Ming, Yifei, Shi, Zhenmei, Vineet, Vibhav, Wang, Xin, Li, Yixuan, Joshi, Neel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Video Is Not Worth a Thousand Words
por: Pollard, Sam, et al.
Publicado: (2025)
por: Pollard, Sam, et al.
Publicado: (2025)
Vript: A Video Is Worth Thousands of Words
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
A LoRA is Worth a Thousand Pictures
por: Liu, Chenxi, et al.
Publicado: (2024)
por: Liu, Chenxi, et al.
Publicado: (2024)
WordVIS: A Color Worth A Thousand Words
por: Khan, Umar, et al.
Publicado: (2024)
por: Khan, Umar, et al.
Publicado: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
por: Tang, Raphael, et al.
Publicado: (2024)
por: Tang, Raphael, et al.
Publicado: (2024)
Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes
por: Bagdonaviciute, Ieva, et al.
Publicado: (2025)
por: Bagdonaviciute, Ieva, et al.
Publicado: (2025)
A Picture is Worth a Thousand Words? An Empirical Study of Aggregation Strategies for Visual Financial Document Retrieval
por: Lim, Ho Hung, et al.
Publicado: (2026)
por: Lim, Ho Hung, et al.
Publicado: (2026)
Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity
por: Jung, Jaeyoon, et al.
Publicado: (2026)
por: Jung, Jaeyoon, et al.
Publicado: (2026)
Navigating Hallucinations for Reasoning of Unintentional Activities
por: Grover, Shresth, et al.
Publicado: (2024)
por: Grover, Shresth, et al.
Publicado: (2024)
An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs
por: Luo, Zhi, et al.
Publicado: (2025)
por: Luo, Zhi, et al.
Publicado: (2025)
Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion
por: Haviv, Adi, et al.
Publicado: (2024)
por: Haviv, Adi, et al.
Publicado: (2024)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
por: Ming, Yifei, et al.
Publicado: (2024)
por: Ming, Yifei, et al.
Publicado: (2024)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
por: Joshi, Siddharth, et al.
Publicado: (2025)
por: Joshi, Siddharth, et al.
Publicado: (2025)
A Picture is Worth a Thousand (Correct) Captions: A Vision-Guided Judge-Corrector System for Multimodal Machine Translation
por: Betala, Siddharth, et al.
Publicado: (2025)
por: Betala, Siddharth, et al.
Publicado: (2025)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
por: Ming, Yifei, et al.
Publicado: (2023)
por: Ming, Yifei, et al.
Publicado: (2023)
Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames
por: Ravi, Sahithya, et al.
Publicado: (2025)
por: Ravi, Sahithya, et al.
Publicado: (2025)
One Image is Worth a Thousand Words: A Usability Preservable Text-Image Collaborative Erasing Framework
por: Li, Feiran, et al.
Publicado: (2025)
por: Li, Feiran, et al.
Publicado: (2025)
Understanding Depth and Height Perception in Large Visual-Language Models
por: Azad, Shehreen, et al.
Publicado: (2024)
por: Azad, Shehreen, et al.
Publicado: (2024)
A Label is Worth a Thousand Images in Dataset Distillation
por: Qin, Tian, et al.
Publicado: (2024)
por: Qin, Tian, et al.
Publicado: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
Delving into Out-of-Distribution Detection with Medical Vision-Language Models
por: Ju, Lie, et al.
Publicado: (2025)
por: Ju, Lie, et al.
Publicado: (2025)
Delving into Spectral Clustering with Vision-Language Representations
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
A Picture is Worth a Thousand Prompts? Efficacy of Iterative Human-Driven Prompt Refinement in Image Regeneration Tasks
por: Trinh, Khoi, et al.
Publicado: (2025)
por: Trinh, Khoi, et al.
Publicado: (2025)
A Large-Scale Analysis on Contextual Self-Supervised Video Representation Learning
por: Kumar, Akash, et al.
Publicado: (2025)
por: Kumar, Akash, et al.
Publicado: (2025)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
por: Liu, Junming, et al.
Publicado: (2026)
por: Liu, Junming, et al.
Publicado: (2026)
Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models
por: Moayeri, Mazda, et al.
Publicado: (2024)
por: Moayeri, Mazda, et al.
Publicado: (2024)
An Embedding is Worth a Thousand Noisy Labels
por: Di Salvo, Francesco, et al.
Publicado: (2024)
por: Di Salvo, Francesco, et al.
Publicado: (2024)
HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding
por: Azad, Shehreen, et al.
Publicado: (2025)
por: Azad, Shehreen, et al.
Publicado: (2025)
StreamReady: Learning What to Answer and When in Long Streaming Videos
por: Azad, Shehreen, et al.
Publicado: (2026)
por: Azad, Shehreen, et al.
Publicado: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
OmViD: Omni-supervised active learning for video action detection
por: Rana, Aayush, et al.
Publicado: (2025)
por: Rana, Aayush, et al.
Publicado: (2025)
Vision-Language Memory for Spatial Reasoning
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
Modeling Thousands of Human Annotators for Generalizable Text-to-Image Person Re-identification
por: Jiang, Jiayu, et al.
Publicado: (2025)
por: Jiang, Jiayu, et al.
Publicado: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
A Creative Agent is Worth a 64-Token Template
por: Shi, Ruixiao, et al.
Publicado: (2026)
por: Shi, Ruixiao, et al.
Publicado: (2026)
Eureka: Evaluating and Understanding Large Foundation Models
por: Balachandran, Vidhisha, et al.
Publicado: (2024)
por: Balachandran, Vidhisha, et al.
Publicado: (2024)
Malware Detection in Docker Containers: An Image is Worth a Thousand Logs
por: Nousias, Akis, et al.
Publicado: (2025)
por: Nousias, Akis, et al.
Publicado: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Ejemplares similares
-
A Video Is Not Worth a Thousand Words
por: Pollard, Sam, et al.
Publicado: (2025) -
Vript: A Video Is Worth Thousands of Words
por: Yang, Dongjie, et al.
Publicado: (2024) -
A LoRA is Worth a Thousand Pictures
por: Liu, Chenxi, et al.
Publicado: (2024) -
WordVIS: A Color Worth A Thousand Words
por: Khan, Umar, et al.
Publicado: (2024) -
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
por: Tang, Raphael, et al.
Publicado: (2024)