Probing Vision-Language Understanding through the Visual Entailment Task: promises and pitfalls
Fuente:
arXiv
Salvato in:
| Autori principali: | Pitta, Elena, Kouwenhoven, Tom, Verhoef, Tessa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
Understanding Figurative Meaning through Explainable Visual Entailment
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
Compositional Entailment Learning for Hyperbolic Vision-Language Models
di: Pal, Avik, et al.
Pubblicazione: (2024)
di: Pal, Avik, et al.
Pubblicazione: (2024)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
di: Guo, Grace, et al.
Pubblicazione: (2024)
di: Guo, Grace, et al.
Pubblicazione: (2024)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding
di: Mathew, Athul M., et al.
Pubblicazione: (2025)
di: Mathew, Athul M., et al.
Pubblicazione: (2025)
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Language-Guided Invariance Probing of Vision-Language Models
di: Lee, Jae Joong
Pubblicazione: (2025)
di: Lee, Jae Joong
Pubblicazione: (2025)
Understanding Cross Task Generalization in Handwriting-Based Alzheimer's Screening via Vision Language Adaptation
di: Gong, Changqing, et al.
Pubblicazione: (2025)
di: Gong, Changqing, et al.
Pubblicazione: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
di: Tartaglini, Alexa R., et al.
Pubblicazione: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
di: Zhang, Huaxiang, et al.
Pubblicazione: (2024)
di: Zhang, Huaxiang, et al.
Pubblicazione: (2024)
Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
di: An, Na Min, et al.
Pubblicazione: (2025)
di: An, Na Min, et al.
Pubblicazione: (2025)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025)
di: Kong, Fei, et al.
Pubblicazione: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
di: Ming, Yifei, et al.
Pubblicazione: (2024)
di: Ming, Yifei, et al.
Pubblicazione: (2024)
VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment
di: Saravanan, Darshana, et al.
Pubblicazione: (2024)
di: Saravanan, Darshana, et al.
Pubblicazione: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
di: Wu, Aodi, et al.
Pubblicazione: (2025)
di: Wu, Aodi, et al.
Pubblicazione: (2025)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
di: Zhao, Jianfei, et al.
Pubblicazione: (2025)
Towards Understanding Visual Grounding in Visual Language Models
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models
di: Chen, Qianpu, et al.
Pubblicazione: (2026)
di: Chen, Qianpu, et al.
Pubblicazione: (2026)
Understanding Visual Feature Reliance through the Lens of Complexity
di: Fel, Thomas, et al.
Pubblicazione: (2024)
di: Fel, Thomas, et al.
Pubblicazione: (2024)
ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task
di: Khalil, Ahmad, et al.
Pubblicazione: (2025)
di: Khalil, Ahmad, et al.
Pubblicazione: (2025)
DELST: Dual Entailment Learning for Hyperbolic Image-Gene Pretraining in Spatial Transcriptomics
di: Chen, Xulin, et al.
Pubblicazione: (2025)
di: Chen, Xulin, et al.
Pubblicazione: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
Environmental Understanding Vision-Language Model for Embodied Agent
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
di: Bang, Jinsik, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
Skill-Conditioned Visual Geolocation for Vision-Language Models
di: Yang, Chenjie, et al.
Pubblicazione: (2026)
di: Yang, Chenjie, et al.
Pubblicazione: (2026)
Generative Visual Communication in the Era of Vision-Language Models
di: Vinker, Yael
Pubblicazione: (2024)
di: Vinker, Yael
Pubblicazione: (2024)
Probing and Inducing Combinational Creativity in Vision-Language Models
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
RAU: Reference-based Anatomical Understanding with Vision Language Models
di: Li, Yiwei, et al.
Pubblicazione: (2025)
di: Li, Yiwei, et al.
Pubblicazione: (2025)
Adapting Vision-Language Models for E-commerce Understanding at Scale
di: Nulli, Matteo, et al.
Pubblicazione: (2026)
di: Nulli, Matteo, et al.
Pubblicazione: (2026)
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025) -
Understanding Figurative Meaning through Explainable Visual Entailment
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024) -
Compositional Entailment Learning for Hyperbolic Vision-Language Models
di: Pal, Avik, et al.
Pubblicazione: (2024) -
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
di: Guo, Grace, et al.
Pubblicazione: (2024) -
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)