Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tartaglini, Alexa R., Grant, Satchel, Wurgaft, Daniel, Potts, Christopher, Fan, Judith E. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CHART-6: Human-Centered Evaluation of Data Visualization Understanding in Vision-Language Models
par: Verma, Arnav, et autres
Publié: (2025)
par: Verma, Arnav, et autres
Publié: (2025)
I Walk the Line: Examining the Role of Gestalt Continuity in Object Binding for Vision Transformers
par: Tartaglini, Alexa R., et autres
Publié: (2026)
par: Tartaglini, Alexa R., et autres
Publié: (2026)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
par: Park, Gyuwon
Publié: (2025)
par: Park, Gyuwon
Publié: (2025)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025)
par: Hayashi, Kazuki, et autres
Publié: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
On the Perception Bottleneck of VLMs for Chart Understanding
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
CommVQA: Situating Visual Question Answering in Communicative Contexts
par: Naik, Nandita Shankar, et autres
Publié: (2024)
par: Naik, Nandita Shankar, et autres
Publié: (2024)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
par: Luo, Chuwei, et autres
Publié: (2022)
par: Luo, Chuwei, et autres
Publié: (2022)
Vision-Language Models Do Not Understand Negation
par: Alhamoud, Kumail, et autres
Publié: (2025)
par: Alhamoud, Kumail, et autres
Publié: (2025)
Do Vision-Language Models Understand Compound Nouns?
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
par: Kim, Geewook, et autres
Publié: (2024)
par: Kim, Geewook, et autres
Publié: (2024)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
par: Huemann, Zachary, et autres
Publié: (2025)
par: Huemann, Zachary, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
par: Guo, Danfeng, et autres
Publié: (2024)
par: Guo, Danfeng, et autres
Publié: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
par: Xue, Wei, et autres
Publié: (2023)
par: Xue, Wei, et autres
Publié: (2023)
Toward Interactive Regional Understanding in Vision-Large Language Models
par: Lee, Jungbeom, et autres
Publié: (2024)
par: Lee, Jungbeom, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
par: Chung, Jiwan, et autres
Publié: (2024)
par: Chung, Jiwan, et autres
Publié: (2024)
BabyVision: Visual Reasoning Beyond Language
par: Chen, Liang, et autres
Publié: (2026)
par: Chen, Liang, et autres
Publié: (2026)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
par: Keleş, Onur, et autres
Publié: (2025)
par: Keleş, Onur, et autres
Publié: (2025)
Understanding Museum Exhibits using Vision-Language Reasoning
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
par: Dai, Haocheng, et autres
Publié: (2024)
par: Dai, Haocheng, et autres
Publié: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
par: Hu, Yushi, et autres
Publié: (2023)
par: Hu, Yushi, et autres
Publié: (2023)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
Documents similaires
-
CHART-6: Human-Centered Evaluation of Data Visualization Understanding in Vision-Language Models
par: Verma, Arnav, et autres
Publié: (2025) -
I Walk the Line: Examining the Role of Gestalt Continuity in Object Binding for Vision Transformers
par: Tartaglini, Alexa R., et autres
Publié: (2026) -
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024) -
Do Vision-Language Models Understand Visual Persuasiveness?
par: Park, Gyuwon
Publié: (2025) -
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025)