Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zheyuan, Hu, Fengyuan, Lee, Jayjun, Shi, Freda, Kordjamshidi, Parisa, Chai, Joyce, Ma, Ziqiao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks
by: Premsri, Tanawan, et al.
Published: (2025)
by: Premsri, Tanawan, et al.
Published: (2025)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
by: Premsri, Tanawan, et al.
Published: (2025)
by: Premsri, Tanawan, et al.
Published: (2025)
Exploring Spatial Language Grounding Through Referring Expressions
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
Narrowing the Gap between Vision and Action in Navigation
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
by: Yu, Keunwoo Peter, et al.
Published: (2023)
by: Yu, Keunwoo Peter, et al.
Published: (2023)
Neuro-symbolic Training for Reasoning over Spatial Language
by: Premsri, Tanawan, et al.
Published: (2024)
by: Premsri, Tanawan, et al.
Published: (2024)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
by: Kamali, Danial, et al.
Published: (2025)
by: Kamali, Danial, et al.
Published: (2025)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
by: Ma, Ziqiao, et al.
Published: (2023)
by: Ma, Ziqiao, et al.
Published: (2023)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
by: Dai, Yinpei, et al.
Published: (2024)
by: Dai, Yinpei, et al.
Published: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
by: Wu, Shuyu, et al.
Published: (2025)
by: Wu, Shuyu, et al.
Published: (2025)
NavHint: Vision and Language Navigation Agent with a Hint Generator
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
by: Ma, Tianyi, et al.
Published: (2025)
by: Ma, Tianyi, et al.
Published: (2025)
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
by: Ma, Ziqiao, et al.
Published: (2024)
by: Ma, Ziqiao, et al.
Published: (2024)
Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation
by: Ma, Ziqiao, et al.
Published: (2025)
by: Ma, Ziqiao, et al.
Published: (2025)
Consistent Joint Decision-Making with Heterogeneous Learning Models
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
by: Faghihi, Hossein Rajaby, et al.
Published: (2024)
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
by: Ogezi, Michael, et al.
Published: (2025)
by: Ogezi, Michael, et al.
Published: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
by: Barezi, Elham J., et al.
Published: (2024)
by: Barezi, Elham J., et al.
Published: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
by: Zhang, Yue, et al.
Published: (2025)
by: Zhang, Yue, et al.
Published: (2025)
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
by: Ma, Ziqiao, et al.
Published: (2023)
by: Ma, Ziqiao, et al.
Published: (2023)
How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
by: Liao, Disen, et al.
Published: (2026)
by: Liao, Disen, et al.
Published: (2026)
Fast Spatial Memory with Elastic Test-Time Training
by: Ma, Ziqiao, et al.
Published: (2026)
by: Ma, Ziqiao, et al.
Published: (2026)
ViTaSCOPE: Visuo-tactile Implicit Representation for In-hand Pose and Extrinsic Contact Estimation
by: Lee, Jayjun, et al.
Published: (2025)
by: Lee, Jayjun, et al.
Published: (2025)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
by: Huang, Yidong, et al.
Published: (2024)
by: Huang, Yidong, et al.
Published: (2024)
NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization
by: Kamali, Danial, et al.
Published: (2024)
by: Kamali, Danial, et al.
Published: (2024)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
Neuro-Symbolic Frameworks: Conceptual Characterization and Empirical Comparative Analysis
by: Sinha, Sania, et al.
Published: (2025)
by: Sinha, Sania, et al.
Published: (2025)
Next-Embedding Prediction Makes Strong Vision Learners
by: Xu, Sihan, et al.
Published: (2025)
by: Xu, Sihan, et al.
Published: (2025)
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
by: Xu, Sihan, et al.
Published: (2023)
by: Xu, Sihan, et al.
Published: (2023)
Learning Language Structures through Grounding
by: Shi, Freda
Published: (2024)
by: Shi, Freda
Published: (2024)
Multi-Object Hallucination in Vision-Language Models
by: Chen, Xuweiyi, et al.
Published: (2024)
by: Chen, Xuweiyi, et al.
Published: (2024)
Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models
by: Jiang, Yifan, et al.
Published: (2026)
by: Jiang, Yifan, et al.
Published: (2026)
Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery
by: Jiang, Yifan, et al.
Published: (2026)
by: Jiang, Yifan, et al.
Published: (2026)
Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law
by: Kordjamshidi, Parisa, et al.
Published: (2026)
by: Kordjamshidi, Parisa, et al.
Published: (2026)
LingGym: How Far Are LLMs from Thinking Like Field Linguists?
by: Yang, Changbing, et al.
Published: (2025)
by: Yang, Changbing, et al.
Published: (2025)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Learning vs Retrieval: The Role of In-Context Examples in Regression with Large Language Models
by: Nafar, Aliakbar, et al.
Published: (2024)
by: Nafar, Aliakbar, et al.
Published: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
by: Nafar, Aliakbar, et al.
Published: (2024)
by: Nafar, Aliakbar, et al.
Published: (2024)
Teaching Probabilistic Logical Reasoning to Transformers
by: Nafar, Aliakbar, et al.
Published: (2023)
by: Nafar, Aliakbar, et al.
Published: (2023)
Similar Items
-
FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks
by: Premsri, Tanawan, et al.
Published: (2025) -
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
by: Premsri, Tanawan, et al.
Published: (2025) -
Exploring Spatial Language Grounding Through Referring Expressions
by: Tumu, Akshar, et al.
Published: (2025) -
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
by: Tumu, Akshar, et al.
Published: (2025) -
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
by: Zhang, Yue, et al.
Published: (2024)