Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Yige, Wang, Yongjie, Wu, Zizhuo, Song, Kaisong, Lin, Jun, Shen, Zhiqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Abstraction Gap in Vision-Language Causal Reasoning
di: Hoang, Chinh, et al.
Pubblicazione: (2026)
di: Hoang, Chinh, et al.
Pubblicazione: (2026)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
di: Oh, Hongseok, et al.
Pubblicazione: (2025)
di: Oh, Hongseok, et al.
Pubblicazione: (2025)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
di: Gao, Junyuan, et al.
Pubblicazione: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?
di: Song, Yingjin, et al.
Pubblicazione: (2025)
di: Song, Yingjin, et al.
Pubblicazione: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
di: Gigant, Théo, et al.
Pubblicazione: (2025)
di: Gigant, Théo, et al.
Pubblicazione: (2025)
Vision-Language Models Do Not Understand Negation
di: Alhamoud, Kumail, et al.
Pubblicazione: (2025)
di: Alhamoud, Kumail, et al.
Pubblicazione: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Modality-Agnostic fMRI Decoding of Vision and Language
di: Nikolaus, Mitja, et al.
Pubblicazione: (2024)
di: Nikolaus, Mitja, et al.
Pubblicazione: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Do Vision-Language Models Really Understand Visual Language?
di: Hou, Yifan, et al.
Pubblicazione: (2024)
di: Hou, Yifan, et al.
Pubblicazione: (2024)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2026)
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2026)
Do Vision-Language Models Understand Compound Nouns?
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
di: Park, Gyuwon
Pubblicazione: (2025)
di: Park, Gyuwon
Pubblicazione: (2025)
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
di: Ranjan, Mukul, et al.
Pubblicazione: (2026)
di: Ranjan, Mukul, et al.
Pubblicazione: (2026)
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
di: Wang, Yongjie, et al.
Pubblicazione: (2025)
di: Wang, Yongjie, et al.
Pubblicazione: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
Vision as LoRA
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
di: Li, Xue, et al.
Pubblicazione: (2025)
di: Li, Xue, et al.
Pubblicazione: (2025)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
di: Han, Feng, et al.
Pubblicazione: (2026)
di: Han, Feng, et al.
Pubblicazione: (2026)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
Understanding Museum Exhibits using Vision-Language Reasoning
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
di: Kojima, Noriyuki, et al.
Pubblicazione: (2023)
di: Kojima, Noriyuki, et al.
Pubblicazione: (2023)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
How Do Vision-Language Models Process Conflicting Information Across Modalities?
di: Hua, Tianze, et al.
Pubblicazione: (2025)
di: Hua, Tianze, et al.
Pubblicazione: (2025)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
Narrowing the Gap between Vision and Action in Navigation
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The Abstraction Gap in Vision-Language Causal Reasoning
di: Hoang, Chinh, et al.
Pubblicazione: (2026) -
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025) -
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
di: Xu, Zhiyang, et al.
Pubblicazione: (2024) -
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026) -
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)