Train a Unified Multimodal Data Quality Classifier with Synthetic Data

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Weizhi, Lin, Rongmei, Li, Shiyang, Lockard, Colin, Sarkhel, Ritesh, Lokegaonkar, Sanket, Shang, Jingbo, Yan, Xifeng, Zalmout, Nasser, Li, Xian
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866912653888192512
author Wang, Weizhi
Lin, Rongmei
Li, Shiyang
Lockard, Colin
Sarkhel, Ritesh
Lokegaonkar, Sanket
Shang, Jingbo
Yan, Xifeng
Zalmout, Nasser
Li, Xian
author_facet Wang, Weizhi
Lin, Rongmei
Li, Shiyang
Lockard, Colin
Sarkhel, Ritesh
Lokegaonkar, Sanket
Shang, Jingbo
Yan, Xifeng
Zalmout, Nasser
Li, Xian
contents The Multimodal Large Language Models (MLLMs) are continually pre-trained on a mixture of image-text caption data and interleaved document data, while the high-quality data filtering towards image-text interleaved document data is under-explored. We propose to train an efficient MLLM as a Unified Mulitmodal Data Quality Classifier to Filter both high-quality image-text caption and interleaved data (UniFilter). To address the challenge of collecting diverse labeled multimodal data, we introduce a semi-synthetic approach that leverages readily available raw images and generates corresponding text across four quality levels. This method enables efficient creation of sample-score pairs for both caption and interleaved document data to train UniFilter. We apply UniFilter to curate high-quality caption data from DataComp caption dataset and interleaved data from the OBELICS image-text interleaved dataset. MLLMs pre-trained on the filtered data demonstrate significantly enhanced capabilities compared to those trained on baseline-filtered data, achieving stronger zero-shot reasoning and in-context learning capabilities. After visual supervised fine-tuning, these UniFilter-induced MLLMs achieve stronger performance on various benchmarks, highlighting the downstream benefits of high-quality multimodal pre-training. We release the synthetic training data used for training UniFilter, the UniFilter model checkpoints, and the high-quality interleaved document subset OBELICS-HQ, curated by UniFilter, to the community for reproduction and further development.
format Preprint
id arxiv_https___arxiv_org_abs_2510_15162
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Train a Unified Multimodal Data Quality Classifier with Synthetic Data
Wang, Weizhi
Lin, Rongmei
Li, Shiyang
Lockard, Colin
Sarkhel, Ritesh
Lokegaonkar, Sanket
Shang, Jingbo
Yan, Xifeng
Zalmout, Nasser
Li, Xian
Computer Vision and Pattern Recognition
Computation and Language
The Multimodal Large Language Models (MLLMs) are continually pre-trained on a mixture of image-text caption data and interleaved document data, while the high-quality data filtering towards image-text interleaved document data is under-explored. We propose to train an efficient MLLM as a Unified Mulitmodal Data Quality Classifier to Filter both high-quality image-text caption and interleaved data (UniFilter). To address the challenge of collecting diverse labeled multimodal data, we introduce a semi-synthetic approach that leverages readily available raw images and generates corresponding text across four quality levels. This method enables efficient creation of sample-score pairs for both caption and interleaved document data to train UniFilter. We apply UniFilter to curate high-quality caption data from DataComp caption dataset and interleaved data from the OBELICS image-text interleaved dataset. MLLMs pre-trained on the filtered data demonstrate significantly enhanced capabilities compared to those trained on baseline-filtered data, achieving stronger zero-shot reasoning and in-context learning capabilities. After visual supervised fine-tuning, these UniFilter-induced MLLMs achieve stronger performance on various benchmarks, highlighting the downstream benefits of high-quality multimodal pre-training. We release the synthetic training data used for training UniFilter, the UniFilter model checkpoints, and the high-quality interleaved document subset OBELICS-HQ, curated by UniFilter, to the community for reproduction and further development.
title Train a Unified Multimodal Data Quality Classifier with Synthetic Data
topic Computer Vision and Pattern Recognition
Computation and Language
url https://arxiv.org/abs/2510.15162