Robust Multimodal Learning via Cross-Modal Proxy Tokens

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Reza, Md Kaykobad, Patil, Ameya, Solh, Mashhour, Asif, M. Salman
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918170472742912
author Reza, Md Kaykobad
Patil, Ameya
Solh, Mashhour
Asif, M. Salman
author_facet Reza, Md Kaykobad
Patil, Ameya
Solh, Mashhour
Asif, M. Salman
contents Multimodal models often experience a significant performance drop when one or more modalities are missing during inference. To address this challenge, we propose a simple yet effective approach that enhances robustness to missing modalities while maintaining strong performance when all modalities are available. Our method introduces cross-modal proxy tokens (CMPTs), which approximate the class token of a missing modality by attending only to the tokens of the available modality without requiring explicit modality generation or auxiliary networks. To efficiently learn these approximations with minimal computational overhead, we employ low-rank adapters in frozen unimodal encoders and jointly optimize an alignment loss with a task-specific loss. Extensive experiments on five multimodal datasets show that our method outperforms state-of-the-art baselines across various missing rates while achieving competitive results in complete-modality settings. Overall, our method offers a flexible and efficient solution for robust multimodal learning. The code for this paper is available at: https://github.com/CSIPlab/Cross-Modal-Proxy-Tokens.
format Preprint
id arxiv_https___arxiv_org_abs_2501_17823
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Robust Multimodal Learning via Cross-Modal Proxy Tokens
Reza, Md Kaykobad
Patil, Ameya
Solh, Mashhour
Asif, M. Salman
Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
Multimodal models often experience a significant performance drop when one or more modalities are missing during inference. To address this challenge, we propose a simple yet effective approach that enhances robustness to missing modalities while maintaining strong performance when all modalities are available. Our method introduces cross-modal proxy tokens (CMPTs), which approximate the class token of a missing modality by attending only to the tokens of the available modality without requiring explicit modality generation or auxiliary networks. To efficiently learn these approximations with minimal computational overhead, we employ low-rank adapters in frozen unimodal encoders and jointly optimize an alignment loss with a task-specific loss. Extensive experiments on five multimodal datasets show that our method outperforms state-of-the-art baselines across various missing rates while achieving competitive results in complete-modality settings. Overall, our method offers a flexible and efficient solution for robust multimodal learning. The code for this paper is available at: https://github.com/CSIPlab/Cross-Modal-Proxy-Tokens.
title Robust Multimodal Learning via Cross-Modal Proxy Tokens
topic Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
url https://arxiv.org/abs/2501.17823