Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Zhaochen, Hooi, Bryan, Wang, Yiwei, Yang, Ming-Hsuan, Huang, Zi, Cai, Yujun
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866912315743404032
author Wang, Zhaochen
Hooi, Bryan
Wang, Yiwei
Yang, Ming-Hsuan
Huang, Zi
Cai, Yujun
author_facet Wang, Zhaochen
Hooi, Bryan
Wang, Yiwei
Yang, Ming-Hsuan
Huang, Zi
Cai, Yujun
contents Vision-language models (VLMs) have advanced rapidly in processing multimodal information, but their ability to reconcile conflicting signals across modalities remains underexplored. This work investigates how VLMs process ASCII art, a unique medium where textual elements collectively form visual patterns, potentially creating semantic-visual conflicts. We introduce a novel evaluation framework that systematically challenges five state-of-the-art models (including GPT-4o, Claude, and Gemini) using adversarial ASCII art, where character-level semantics deliberately contradict global visual patterns. Our experiments reveal a strong text-priority bias: VLMs consistently prioritize textual information over visual patterns, with visual recognition ability declining dramatically as semantic complexity increases. Various mitigation attempts through visual parameter tuning and prompt engineering yielded only modest improvements, suggesting that this limitation requires architectural-level solutions. These findings uncover fundamental flaws in how current VLMs integrate multimodal information, providing important guidance for future model development while highlighting significant implications for content moderation systems vulnerable to adversarial examples.
format Preprint
id arxiv_https___arxiv_org_abs_2504_01589
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
Wang, Zhaochen
Hooi, Bryan
Wang, Yiwei
Yang, Ming-Hsuan
Huang, Zi
Cai, Yujun
Computer Vision and Pattern Recognition
Artificial Intelligence
Vision-language models (VLMs) have advanced rapidly in processing multimodal information, but their ability to reconcile conflicting signals across modalities remains underexplored. This work investigates how VLMs process ASCII art, a unique medium where textual elements collectively form visual patterns, potentially creating semantic-visual conflicts. We introduce a novel evaluation framework that systematically challenges five state-of-the-art models (including GPT-4o, Claude, and Gemini) using adversarial ASCII art, where character-level semantics deliberately contradict global visual patterns. Our experiments reveal a strong text-priority bias: VLMs consistently prioritize textual information over visual patterns, with visual recognition ability declining dramatically as semantic complexity increases. Various mitigation attempts through visual parameter tuning and prompt engineering yielded only modest improvements, suggesting that this limitation requires architectural-level solutions. These findings uncover fundamental flaws in how current VLMs integrate multimodal information, providing important guidance for future model development while highlighting significant implications for content moderation systems vulnerable to adversarial examples.
title Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2504.01589