Can Text-to-image Model Assist Multi-modal Learning for Visual Recognition with Visual Modality Missing?

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Feng, Tiantian, Yang, Daniel, Bose, Digbalay, Narayanan, Shrikanth
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866910331056422912
author Feng, Tiantian
Yang, Daniel
Bose, Digbalay
Narayanan, Shrikanth
author_facet Feng, Tiantian
Yang, Daniel
Bose, Digbalay
Narayanan, Shrikanth
contents Multi-modal learning has emerged as an increasingly promising avenue in vision recognition, driving innovations across diverse domains ranging from media and education to healthcare and transportation. Despite its success, the robustness of multi-modal learning for visual recognition is often challenged by the unavailability of a subset of modalities, especially the visual modality. Conventional approaches to mitigate missing modalities in multi-modal learning rely heavily on algorithms and modality fusion schemes. In contrast, this paper explores the use of text-to-image models to assist multi-modal learning. Specifically, we propose a simple but effective multi-modal learning framework GTI-MM to enhance the data efficiency and model robustness against missing visual modality by imputing the missing data with generative transformers. Using multiple multi-modal datasets with visual recognition tasks, we present a comprehensive analysis of diverse conditions involving missing visual modality in data, including model training. Our findings reveal that synthetic images benefit training data efficiency with visual data missing in training and improve model robustness with visual data missing involving training and testing. Moreover, we demonstrate GTI-MM is effective with lower generation quantity and simple prompt techniques.
format Preprint
id arxiv_https___arxiv_org_abs_2402_09036
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Can Text-to-image Model Assist Multi-modal Learning for Visual Recognition with Visual Modality Missing?
Feng, Tiantian
Yang, Daniel
Bose, Digbalay
Narayanan, Shrikanth
Computer Vision and Pattern Recognition
Multi-modal learning has emerged as an increasingly promising avenue in vision recognition, driving innovations across diverse domains ranging from media and education to healthcare and transportation. Despite its success, the robustness of multi-modal learning for visual recognition is often challenged by the unavailability of a subset of modalities, especially the visual modality. Conventional approaches to mitigate missing modalities in multi-modal learning rely heavily on algorithms and modality fusion schemes. In contrast, this paper explores the use of text-to-image models to assist multi-modal learning. Specifically, we propose a simple but effective multi-modal learning framework GTI-MM to enhance the data efficiency and model robustness against missing visual modality by imputing the missing data with generative transformers. Using multiple multi-modal datasets with visual recognition tasks, we present a comprehensive analysis of diverse conditions involving missing visual modality in data, including model training. Our findings reveal that synthetic images benefit training data efficiency with visual data missing in training and improve model robustness with visual data missing involving training and testing. Moreover, we demonstrate GTI-MM is effective with lower generation quantity and simple prompt techniques.
title Can Text-to-image Model Assist Multi-modal Learning for Visual Recognition with Visual Modality Missing?
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2402.09036