Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Wenrui, Lyu, Dalin, Wang, Weihang, Feng, Jie, Gao, Chen, Li, Yong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
von: Atuhurra, Jesse, et al.
Veröffentlicht: (2024)
von: Atuhurra, Jesse, et al.
Veröffentlicht: (2024)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
von: Chen, Feng, et al.
Veröffentlicht: (2024)
von: Chen, Feng, et al.
Veröffentlicht: (2024)
The BLA Benchmark: Investigating Basic Language Abilities of Pre-Trained Multimodal Models
von: Chen, Xinyi, et al.
Veröffentlicht: (2023)
von: Chen, Xinyi, et al.
Veröffentlicht: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
von: Feng, Jie, et al.
Veröffentlicht: (2025)
von: Feng, Jie, et al.
Veröffentlicht: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
Clean Evaluations on Contaminated Visual Language Models
von: Lu, Hongyuan, et al.
Veröffentlicht: (2024)
von: Lu, Hongyuan, et al.
Veröffentlicht: (2024)
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
von: Geigle, Gregor, et al.
Veröffentlicht: (2025)
von: Geigle, Gregor, et al.
Veröffentlicht: (2025)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
von: Góral, Gracjan, et al.
Veröffentlicht: (2024)
von: Góral, Gracjan, et al.
Veröffentlicht: (2024)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2023)
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2023)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
von: Liu, Jie, et al.
Veröffentlicht: (2024)
von: Liu, Jie, et al.
Veröffentlicht: (2024)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
Grounding Language Models for Visual Entity Recognition
von: Xiao, Zilin, et al.
Veröffentlicht: (2024)
von: Xiao, Zilin, et al.
Veröffentlicht: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
von: Xu, Runsen, et al.
Veröffentlicht: (2025)
von: Xu, Runsen, et al.
Veröffentlicht: (2025)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
von: Zhan, Shaoxiong, et al.
Veröffentlicht: (2026)
von: Zhan, Shaoxiong, et al.
Veröffentlicht: (2026)
Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System
von: He, Lixuan, et al.
Veröffentlicht: (2025)
von: He, Lixuan, et al.
Veröffentlicht: (2025)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
von: Liang, Yiming, et al.
Veröffentlicht: (2026)
von: Liang, Yiming, et al.
Veröffentlicht: (2026)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
von: Zhao, Yiming, et al.
Veröffentlicht: (2025)
von: Zhao, Yiming, et al.
Veröffentlicht: (2025)
The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
von: Keleş, Onur, et al.
Veröffentlicht: (2025)
von: Keleş, Onur, et al.
Veröffentlicht: (2025)
Cross-Lingual Text-Rich Visual Comprehension: An Information Theory Perspective
von: Yu, Xinmiao, et al.
Veröffentlicht: (2024)
von: Yu, Xinmiao, et al.
Veröffentlicht: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
von: Lu, Jiaying, et al.
Veröffentlicht: (2023)
CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning
von: Qi, Ji, et al.
Veröffentlicht: (2024)
von: Qi, Ji, et al.
Veröffentlicht: (2024)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
von: Cheng, Sijie, et al.
Veröffentlicht: (2023)
von: Cheng, Sijie, et al.
Veröffentlicht: (2023)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
von: Li, Dingming, et al.
Veröffentlicht: (2025)
von: Li, Dingming, et al.
Veröffentlicht: (2025)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
von: Wang, Zhiqiang, et al.
Veröffentlicht: (2025)
von: Wang, Zhiqiang, et al.
Veröffentlicht: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
von: Cheng, Zihui, et al.
Veröffentlicht: (2025)
von: Cheng, Zihui, et al.
Veröffentlicht: (2025)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2024)
SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
von: Zhou, Xiaolong, et al.
Veröffentlicht: (2026)
von: Zhou, Xiaolong, et al.
Veröffentlicht: (2026)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
von: Kang, Zhaolu, et al.
Veröffentlicht: (2025)
von: Kang, Zhaolu, et al.
Veröffentlicht: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2026)
von: Irawan, Patrick Amadeus, et al.
Veröffentlicht: (2026)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
von: Li, Bin, et al.
Veröffentlicht: (2025)
von: Li, Bin, et al.
Veröffentlicht: (2025)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
von: Ma, Chuang, et al.
Veröffentlicht: (2026)
von: Ma, Chuang, et al.
Veröffentlicht: (2026)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
Visual Representations inside the Language Model
von: Liu, Benlin, et al.
Veröffentlicht: (2025)
von: Liu, Benlin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2025) -
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
von: Wang, Weihang, et al.
Veröffentlicht: (2025) -
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
von: Atuhurra, Jesse, et al.
Veröffentlicht: (2024) -
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
von: Chen, Feng, et al.
Veröffentlicht: (2024) -
The BLA Benchmark: Investigating Basic Language Abilities of Pre-Trained Multimodal Models
von: Chen, Xinyi, et al.
Veröffentlicht: (2023)