Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Gupta, Sharut, Sundaram, Shobhita, Wang, Chenyu, Jegelka, Stefanie, Isola, Phillip
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918157629784064
author Gupta, Sharut
Sundaram, Shobhita
Wang, Chenyu
Jegelka, Stefanie
Isola, Phillip
author_facet Gupta, Sharut
Sundaram, Shobhita
Wang, Chenyu
Jegelka, Stefanie
Isola, Phillip
contents Traditional multimodal learners find unified representations for tasks like visual question answering, but rely heavily on paired datasets. However, an overlooked yet potentially powerful question is: can one leverage auxiliary unpaired multimodal data to directly enhance representation learning in a target modality? We introduce UML: Unpaired Multimodal Learner, a modality-agnostic training paradigm in which a single model alternately processes inputs from different modalities while sharing parameters across them. This design exploits the assumption that different modalities are projections of a shared underlying reality, allowing the model to benefit from cross-modal structure without requiring explicit pairs. Theoretically, under linear data-generating assumptions, we show that unpaired auxiliary data can yield representations strictly more informative about the data-generating process than unimodal training. Empirically, we show that using unpaired data from auxiliary modalities -- such as text, audio, or images -- consistently improves downstream performance across diverse unimodal targets such as image and audio. Our project page: https://unpaired-multimodal.github.io/
format Preprint
id arxiv_https___arxiv_org_abs_2510_08492
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
Gupta, Sharut
Sundaram, Shobhita
Wang, Chenyu
Jegelka, Stefanie
Isola, Phillip
Machine Learning
Computer Vision and Pattern Recognition
Traditional multimodal learners find unified representations for tasks like visual question answering, but rely heavily on paired datasets. However, an overlooked yet potentially powerful question is: can one leverage auxiliary unpaired multimodal data to directly enhance representation learning in a target modality? We introduce UML: Unpaired Multimodal Learner, a modality-agnostic training paradigm in which a single model alternately processes inputs from different modalities while sharing parameters across them. This design exploits the assumption that different modalities are projections of a shared underlying reality, allowing the model to benefit from cross-modal structure without requiring explicit pairs. Theoretically, under linear data-generating assumptions, we show that unpaired auxiliary data can yield representations strictly more informative about the data-generating process than unimodal training. Empirically, we show that using unpaired data from auxiliary modalities -- such as text, audio, or images -- consistently improves downstream performance across diverse unimodal targets such as image and audio. Our project page: https://unpaired-multimodal.github.io/
title Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
topic Machine Learning
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2510.08492