Taming Modality Entanglement in Continual Audio-Visual Segmentation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Hong, Yuyang, Yang, Qi, Zhang, Tao, Wang, Zili, Fu, Zhaojin, Ding, Kun, Fan, Bin, Xiang, Shiming
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866918377118760960
author Hong, Yuyang
Yang, Qi
Zhang, Tao
Wang, Zili
Fu, Zhaojin
Ding, Kun
Fan, Bin
Xiang, Shiming
author_facet Hong, Yuyang
Yang, Qi
Zhang, Tao
Wang, Zili
Fu, Zhaojin
Ding, Kun
Fan, Bin
Xiang, Shiming
contents Recently, significant progress has been made in multi-modal continual learning, aiming to learn new tasks sequentially in multi-modal settings while preserving performance on previously learned ones. However, existing methods mainly focus on coarse-grained tasks, with limitations in addressing modality entanglement in fine-grained continual learning settings. To bridge this gap, we introduce a novel Continual Audio-Visual Segmentation (CAVS) task, aiming to continuously segment new classes guided by audio. Through comprehensive analysis, two critical challenges are identified: 1) multi-modal semantic drift, where a sounding objects is labeled as background in sequential tasks; 2) co-occurrence confusion, where frequent co-occurring classes tend to be confused. In this work, a Collision-based Multi-modal Rehearsal (CMR) framework is designed to address these challenges. Specifically, for multi-modal semantic drift, a Multi-modal Sample Selection (MSS) strategy is proposed to select samples with high modal consistency for rehearsal. Meanwhile, for co-occurence confusion, a Collision-based Sample Rehearsal (CSR) mechanism is designed, allowing for the increase of rehearsal sample frequency of those confusable classes during training process. Moreover, we construct three audio-visual incremental scenarios to verify effectiveness of our method. Comprehensive experiments demonstrate that our method significantly outperforms single-modal continual learning methods.
format Preprint
id arxiv_https___arxiv_org_abs_2510_17234
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Taming Modality Entanglement in Continual Audio-Visual Segmentation
Hong, Yuyang
Yang, Qi
Zhang, Tao
Wang, Zili
Fu, Zhaojin
Ding, Kun
Fan, Bin
Xiang, Shiming
Multimedia
Artificial Intelligence
Computer Vision and Pattern Recognition
Recently, significant progress has been made in multi-modal continual learning, aiming to learn new tasks sequentially in multi-modal settings while preserving performance on previously learned ones. However, existing methods mainly focus on coarse-grained tasks, with limitations in addressing modality entanglement in fine-grained continual learning settings. To bridge this gap, we introduce a novel Continual Audio-Visual Segmentation (CAVS) task, aiming to continuously segment new classes guided by audio. Through comprehensive analysis, two critical challenges are identified: 1) multi-modal semantic drift, where a sounding objects is labeled as background in sequential tasks; 2) co-occurrence confusion, where frequent co-occurring classes tend to be confused. In this work, a Collision-based Multi-modal Rehearsal (CMR) framework is designed to address these challenges. Specifically, for multi-modal semantic drift, a Multi-modal Sample Selection (MSS) strategy is proposed to select samples with high modal consistency for rehearsal. Meanwhile, for co-occurence confusion, a Collision-based Sample Rehearsal (CSR) mechanism is designed, allowing for the increase of rehearsal sample frequency of those confusable classes during training process. Moreover, we construct three audio-visual incremental scenarios to verify effectiveness of our method. Comprehensive experiments demonstrate that our method significantly outperforms single-modal continual learning methods.
title Taming Modality Entanglement in Continual Audio-Visual Segmentation
topic Multimedia
Artificial Intelligence
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2510.17234