Do Vision-Language Models Really Understand Visual Language?
Fuente:
arXiv
Guardado en:
| Autores principales: | Hou, Yifan, Giledereli, Buse, Tu, Yilei, Sachan, Mrinmaya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can Vision-Language Models Solve Visual Math Equations?
por: Choudhury, Monjoy Narayan, et al.
Publicado: (2025)
por: Choudhury, Monjoy Narayan, et al.
Publicado: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
por: Pang, Xingzhou, et al.
Publicado: (2026)
por: Pang, Xingzhou, et al.
Publicado: (2026)
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025)
por: Park, Gyuwon
Publicado: (2025)
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
por: Tong, Yijie, et al.
Publicado: (2026)
por: Tong, Yijie, et al.
Publicado: (2026)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)
por: Liu, Zikang, et al.
Publicado: (2025)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
Do Vision-Language Models Understand Compound Nouns?
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
por: Geigle, Gregor, et al.
Publicado: (2024)
por: Geigle, Gregor, et al.
Publicado: (2024)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
por: Liu, Qing'an, et al.
Publicado: (2026)
por: Liu, Qing'an, et al.
Publicado: (2026)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
por: Wang, Junling, et al.
Publicado: (2026)
por: Wang, Junling, et al.
Publicado: (2026)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
por: Zhang, Yin, et al.
Publicado: (2026)
por: Zhang, Yin, et al.
Publicado: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025)
por: Xia, Yinan, et al.
Publicado: (2025)
Do Multimodal Large Language Models Understand Welding?
por: Khvatskii, Grigorii, et al.
Publicado: (2025)
por: Khvatskii, Grigorii, et al.
Publicado: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Toward Interactive Regional Understanding in Vision-Large Language Models
por: Lee, Jungbeom, et al.
Publicado: (2024)
por: Lee, Jungbeom, et al.
Publicado: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
por: Xue, Wei, et al.
Publicado: (2023)
por: Xue, Wei, et al.
Publicado: (2023)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models
por: Jiang, Yifan, et al.
Publicado: (2026)
por: Jiang, Yifan, et al.
Publicado: (2026)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
por: Zhu, Tinghui, et al.
Publicado: (2024)
por: Zhu, Tinghui, et al.
Publicado: (2024)
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
por: Ryu, Koki, et al.
Publicado: (2026)
por: Ryu, Koki, et al.
Publicado: (2026)
ViLBench: A Suite for Vision-Language Process Reward Modeling
por: Tu, Haoqin, et al.
Publicado: (2025)
por: Tu, Haoqin, et al.
Publicado: (2025)
The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
por: Keleş, Onur, et al.
Publicado: (2025)
por: Keleş, Onur, et al.
Publicado: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
por: Xu, Yige, et al.
Publicado: (2026)
por: Xu, Yige, et al.
Publicado: (2026)
CHART-6: Human-Centered Evaluation of Data Visualization Understanding in Vision-Language Models
por: Verma, Arnav, et al.
Publicado: (2025)
por: Verma, Arnav, et al.
Publicado: (2025)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
por: Huemann, Zachary, et al.
Publicado: (2025)
por: Huemann, Zachary, et al.
Publicado: (2025)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
por: Luo, Weiqing, et al.
Publicado: (2025)
por: Luo, Weiqing, et al.
Publicado: (2025)
Understanding Museum Exhibits using Vision-Language Reasoning
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?
por: Shinozaki, Taiga, et al.
Publicado: (2025)
por: Shinozaki, Taiga, et al.
Publicado: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
por: Atuhurra, Jesse, et al.
Publicado: (2024)
por: Atuhurra, Jesse, et al.
Publicado: (2024)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
por: Perincherry, Akhil, et al.
Publicado: (2025)
por: Perincherry, Akhil, et al.
Publicado: (2025)
Benchmarking Vision Language Models for Cultural Understanding
por: Nayak, Shravan, et al.
Publicado: (2024)
por: Nayak, Shravan, et al.
Publicado: (2024)
Ejemplares similares
-
Can Vision-Language Models Solve Visual Math Equations?
por: Choudhury, Monjoy Narayan, et al.
Publicado: (2025) -
Unveiling the Visual Counting Bottleneck in Vision-Language Models
por: Pang, Xingzhou, et al.
Publicado: (2026) -
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025) -
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
por: Tong, Yijie, et al.
Publicado: (2026) -
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
por: Liu, Zikang, et al.
Publicado: (2025)