Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Song, Dingjie, Lai, Sicheng, Wang, Mingxuan, Chen, Shunian, Sun, Lichao, Wang, Benyou
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914047758172160
author Song, Dingjie
Lai, Sicheng
Wang, Mingxuan
Chen, Shunian
Sun, Lichao
Wang, Benyou
author_facet Song, Dingjie
Lai, Sicheng
Wang, Mingxuan
Chen, Shunian
Sun, Lichao
Wang, Benyou
contents The rapid advancement of multimodal large language models (MLLMs) has significantly enhanced performance across benchmarks. However, data contamination-unintentional memorization of benchmark data during model training-poses critical challenges for fair evaluation. Existing detection methods for unimodal large language models (LLMs) are inadequate for MLLMs due to multimodal data complexity and multi-phase training. We systematically analyze multimodal data contamination using our analytical framework, MM-Detect, which defines two contamination categories-unimodal and cross-modal-and effectively quantifies contamination severity across multiple-choice and caption-based Visual Question Answering tasks. Evaluations on twelve MLLMs and five benchmarks reveal significant contamination, particularly in proprietary models and older benchmarks. Crucially, contamination sometimes originates during unimodal pre-training rather than solely from multimodal fine-tuning. Our insights refine contamination understanding, guiding evaluation practices and improving multimodal model reliability.
format Preprint
id arxiv_https___arxiv_org_abs_2411_03823
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
Song, Dingjie
Lai, Sicheng
Wang, Mingxuan
Chen, Shunian
Sun, Lichao
Wang, Benyou
Computer Vision and Pattern Recognition
Artificial Intelligence
Computation and Language
Multimedia
The rapid advancement of multimodal large language models (MLLMs) has significantly enhanced performance across benchmarks. However, data contamination-unintentional memorization of benchmark data during model training-poses critical challenges for fair evaluation. Existing detection methods for unimodal large language models (LLMs) are inadequate for MLLMs due to multimodal data complexity and multi-phase training. We systematically analyze multimodal data contamination using our analytical framework, MM-Detect, which defines two contamination categories-unimodal and cross-modal-and effectively quantifies contamination severity across multiple-choice and caption-based Visual Question Answering tasks. Evaluations on twelve MLLMs and five benchmarks reveal significant contamination, particularly in proprietary models and older benchmarks. Crucially, contamination sometimes originates during unimodal pre-training rather than solely from multimodal fine-tuning. Our insights refine contamination understanding, guiding evaluation practices and improving multimodal model reliability.
title Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
topic Computer Vision and Pattern Recognition
Artificial Intelligence
Computation and Language
Multimedia
url https://arxiv.org/abs/2411.03823