The Abstraction Gap in Vision-Language Causal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Hoang, Chinh, Hasan, Mohammad Rashedul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
di: Xu, Yige, et al.
Pubblicazione: (2026)
di: Xu, Yige, et al.
Pubblicazione: (2026)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
Understanding Museum Exhibits using Vision-Language Reasoning
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
di: Nguyen, Phuc Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Phuc Minh, et al.
Pubblicazione: (2025)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
di: Bhattacharya, Amartya
Pubblicazione: (2026)
di: Bhattacharya, Amartya
Pubblicazione: (2026)
Narrowing the Gap between Vision and Action in Navigation
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
di: Wang, Qidong, et al.
Pubblicazione: (2026)
di: Wang, Qidong, et al.
Pubblicazione: (2026)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
di: Zha, Yuheng, et al.
Pubblicazione: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination
di: Khandelwal, Anant
Pubblicazione: (2024)
di: Khandelwal, Anant
Pubblicazione: (2024)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
di: Kamath, Amita, et al.
Pubblicazione: (2026)
di: Kamath, Amita, et al.
Pubblicazione: (2026)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
di: Moll, Johannes, et al.
Pubblicazione: (2025)
di: Moll, Johannes, et al.
Pubblicazione: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
di: Arif, Kazi Hasan Ibn, et al.
Pubblicazione: (2025)
di: Arif, Kazi Hasan Ibn, et al.
Pubblicazione: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
di: Kim, Geewook, et al.
Pubblicazione: (2024)
di: Kim, Geewook, et al.
Pubblicazione: (2024)
Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
di: Zhang, Junyi, et al.
Pubblicazione: (2025)
di: Zhang, Junyi, et al.
Pubblicazione: (2025)
Multi-Frame Vision-Language Model for Long-form Reasoning in Driver Behavior Analysis
di: Takato, Hiroshi, et al.
Pubblicazione: (2024)
di: Takato, Hiroshi, et al.
Pubblicazione: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
Bangla Sign Language Translation: Dataset Creation Challenges, Benchmarking and Prospects
di: Rubaiyeat, Husne Ara, et al.
Pubblicazione: (2025)
di: Rubaiyeat, Husne Ara, et al.
Pubblicazione: (2025)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
di: Yang, Cheng, et al.
Pubblicazione: (2026)
di: Yang, Cheng, et al.
Pubblicazione: (2026)
Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
di: Nazi, Zabir Al, et al.
Pubblicazione: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
di: Xia, Yinan, et al.
Pubblicazione: (2025)
di: Xia, Yinan, et al.
Pubblicazione: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
di: Du, Yiyang, et al.
Pubblicazione: (2026)
di: Du, Yiyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025) -
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
di: Xu, Yige, et al.
Pubblicazione: (2026) -
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026) -
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024) -
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)