ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Yuhang, Mei, Wenjie, Zhang, Junkai, He, Guangyu, Niu, Zhenxing, Gao, Haichang
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866910197655535616
author Wang, Yuhang
Mei, Wenjie
Zhang, Junkai
He, Guangyu
Niu, Zhenxing
Gao, Haichang
author_facet Wang, Yuhang
Mei, Wenjie
Zhang, Junkai
He, Guangyu
Niu, Zhenxing
Gao, Haichang
contents Although Multimodal Large Language Models (MLLMs) have achieved remarkable progress across many domains, their training on large-scale multimodal datasets raises serious privacy concerns, making effective machine unlearning increasingly necessary. However, existing benchmarks mainly focus on static or short-sequence settings, offering limited support for evaluating continual privacy deletion requests in realistic deployments. To bridge this gap, we introduce ICU-Bench, a continual multimodal unlearning benchmark built on privacy-critical document data. ICU-Bench contains 1,000 privacy-sensitive profiles from two document domains, medical reports and labor contracts, with 9,500 images, 16,000 question-answer pairs, and 100 forget tasks. Additionally, new continual unlearning metrics are introduced, facilitating a comprehensive analysis of forgetting effectiveness, historical forgetting preservation, retained utility, and stability throughout the continual unlearning process. Through extensive experiments with representative unlearning methods on ICU-Bench, we show that existing methods generally struggle in continual settings and exhibit clear limitations in balancing forgetting quality, utility preservation, and scalability over long task sequences. These findings highlight the need for multimodal unlearning methods explicitly designed for continual privacy deletion.
format Preprint
id arxiv_https___arxiv_org_abs_2605_05938
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
Wang, Yuhang
Mei, Wenjie
Zhang, Junkai
He, Guangyu
Niu, Zhenxing
Gao, Haichang
Artificial Intelligence
Although Multimodal Large Language Models (MLLMs) have achieved remarkable progress across many domains, their training on large-scale multimodal datasets raises serious privacy concerns, making effective machine unlearning increasingly necessary. However, existing benchmarks mainly focus on static or short-sequence settings, offering limited support for evaluating continual privacy deletion requests in realistic deployments. To bridge this gap, we introduce ICU-Bench, a continual multimodal unlearning benchmark built on privacy-critical document data. ICU-Bench contains 1,000 privacy-sensitive profiles from two document domains, medical reports and labor contracts, with 9,500 images, 16,000 question-answer pairs, and 100 forget tasks. Additionally, new continual unlearning metrics are introduced, facilitating a comprehensive analysis of forgetting effectiveness, historical forgetting preservation, retained utility, and stability throughout the continual unlearning process. Through extensive experiments with representative unlearning methods on ICU-Bench, we show that existing methods generally struggle in continual settings and exhibit clear limitations in balancing forgetting quality, utility preservation, and scalability over long task sequences. These findings highlight the need for multimodal unlearning methods explicitly designed for continual privacy deletion.
title ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
topic Artificial Intelligence
url https://arxiv.org/abs/2605.05938