Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Yan, Hanqi, Cui, Xiangxiang, Yin, Lu, Gu, Jindong, Liang, Paul Pu, He, Yulan, Wang, Yifei
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911622060048384
author Yan, Hanqi
Cui, Xiangxiang
Yin, Lu
Gu, Jindong
Liang, Paul Pu
He, Yulan
Wang, Yifei
author_facet Yan, Hanqi
Cui, Xiangxiang
Yin, Lu
Gu, Jindong
Liang, Paul Pu
He, Yulan
Wang, Yifei
contents The success of vision-language models is primarily attributed to effective alignment across modalities such as vision and language. However, modality gaps persist in existing alignment algorithms and appear necessary for human perception as evidenced by modality-specific phenomena like visual texture and linguistic tone. These observations motivate us to computationally measure and leverage modality gaps to improve downstream tasks. We first introduce the Modality Dominance Score (MDS), which attributes multimodal features to specific modalities by categorizing them into three classes: vision-dominant features, language-dominant features, and cross-modal features. We then propose automatic interpretability metrics to evaluate these modality-specific features in a scalable manner. Finally, we demonstrate that the training-free model editing enhances multiple downstream tasks, including mitigating bias in gender classification, generating cross-modal adversarial examples, and enabling modality-specific control in text-to-image generation. Combined with task-agnostic interpretability tools, our work offers insights for systematic analysis and lightweight editing of multimodal models.
format Preprint
id arxiv_https___arxiv_org_abs_2502_14888
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
Yan, Hanqi
Cui, Xiangxiang
Yin, Lu
Gu, Jindong
Liang, Paul Pu
He, Yulan
Wang, Yifei
Computer Vision and Pattern Recognition
Artificial Intelligence
The success of vision-language models is primarily attributed to effective alignment across modalities such as vision and language. However, modality gaps persist in existing alignment algorithms and appear necessary for human perception as evidenced by modality-specific phenomena like visual texture and linguistic tone. These observations motivate us to computationally measure and leverage modality gaps to improve downstream tasks. We first introduce the Modality Dominance Score (MDS), which attributes multimodal features to specific modalities by categorizing them into three classes: vision-dominant features, language-dominant features, and cross-modal features. We then propose automatic interpretability metrics to evaluate these modality-specific features in a scalable manner. Finally, we demonstrate that the training-free model editing enhances multiple downstream tasks, including mitigating bias in gender classification, generating cross-modal adversarial examples, and enabling modality-specific control in text-to-image generation. Combined with task-agnostic interpretability tools, our work offers insights for systematic analysis and lightweight editing of multimodal models.
title Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2502.14888