Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: He, Kang, Ding, Yuzhe, Wang, Xinrong, Li, Fei, Teng, Chong, Ji, Donghong
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866910145532919808
author He, Kang
Ding, Yuzhe
Wang, Xinrong
Li, Fei
Teng, Chong
Ji, Donghong
author_facet He, Kang
Ding, Yuzhe
Wang, Xinrong
Li, Fei
Teng, Chong
Ji, Donghong
contents Multimodal sentiment analysis (MSA) integrates heterogeneous text, audio, and visual signals to infer human emotions. While recent approaches leverage cross-modal complementarity, they often struggle to fully utilize weaker modalities. In practice, dominant modalities tend to overshadow non-verbal ones, inducing modality competition and limiting overall contributions. This imbalance degrades fusion performance and robustness under noisy or missing modalities. To address this, we propose a novel model, Enhance-then-Balance Modality Collaboration framework (EBMC). EBMC improves representation quality via semantic disentanglement and cross-modal enhancement, strengthening weaker modalities. To prevent dominant modalities from overwhelming others, an Energy-guided Modality Coordination mechanism achieves implicit gradient rebalancing via a differentiable equilibrium objective. Furthermore, Instance-aware Modality Trust Distillation estimates sample-level reliability to adaptively modulate fusion weights, ensuring robustness. Extensive experiments demonstrate that EBMC achieves state-of-the-art or competitive results and maintains strong performance under missing-modality settings.
format Preprint
id arxiv_https___arxiv_org_abs_2604_12518
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis
He, Kang
Ding, Yuzhe
Wang, Xinrong
Li, Fei
Teng, Chong
Ji, Donghong
Computation and Language
Multimodal sentiment analysis (MSA) integrates heterogeneous text, audio, and visual signals to infer human emotions. While recent approaches leverage cross-modal complementarity, they often struggle to fully utilize weaker modalities. In practice, dominant modalities tend to overshadow non-verbal ones, inducing modality competition and limiting overall contributions. This imbalance degrades fusion performance and robustness under noisy or missing modalities. To address this, we propose a novel model, Enhance-then-Balance Modality Collaboration framework (EBMC). EBMC improves representation quality via semantic disentanglement and cross-modal enhancement, strengthening weaker modalities. To prevent dominant modalities from overwhelming others, an Energy-guided Modality Coordination mechanism achieves implicit gradient rebalancing via a differentiable equilibrium objective. Furthermore, Instance-aware Modality Trust Distillation estimates sample-level reliability to adaptively modulate fusion weights, ensuring robustness. Extensive experiments demonstrate that EBMC achieves state-of-the-art or competitive results and maintains strong performance under missing-modality settings.
title Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis
topic Computation and Language
url https://arxiv.org/abs/2604.12518