Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Qiu, Xihang, Cheng, Jiarong, Fang, Yuhao, Zhang, Wanpeng, Lu, Yao, Zhang, Ye, Li, Chun
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911244246581248
author Qiu, Xihang
Cheng, Jiarong
Fang, Yuhao
Zhang, Wanpeng
Lu, Yao
Zhang, Ye
Li, Chun
author_facet Qiu, Xihang
Cheng, Jiarong
Fang, Yuhao
Zhang, Wanpeng
Lu, Yao
Zhang, Ye
Li, Chun
contents Multimodal Emotion Recognition in Conversations (MERC) enhances emotional understanding through the fusion of multimodal signals. However, unpredictable modality absence in real-world scenarios significantly degrades the performance of existing methods. Conventional missing-modality recovery approaches, which depend on training with complete multimodal data, often suffer from semantic distortion under extreme data distributions, such as fixed-modality absence. To address this, we propose the Federated Dialogue-guided and Semantic-Consistent Diffusion (FedDISC) framework, pioneering the integration of federated learning into missing-modality recovery. By federated aggregation of modality-specific diffusion models trained on clients and broadcasting them to clients missing corresponding modalities, FedDISC overcomes single-client reliance on modality completeness. Additionally, the DISC-Diffusion module ensures consistency in context, speaker identity, and semantics between recovered and available modalities, using a Dialogue Graph Network to capture conversational dependencies and a Semantic Conditioning Network to enforce semantic alignment. We further introduce a novel Alternating Frozen Aggregation strategy, which cyclically freezes recovery and classifier modules to facilitate collaborative optimization. Extensive experiments on the IEMOCAP, CMUMOSI, and CMUMOSEI datasets demonstrate that FedDISC achieves superior emotion classification performance across diverse missing modality patterns, outperforming existing approaches.
format Preprint
id arxiv_https___arxiv_org_abs_2511_00344
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities
Qiu, Xihang
Cheng, Jiarong
Fang, Yuhao
Zhang, Wanpeng
Lu, Yao
Zhang, Ye
Li, Chun
Computer Vision and Pattern Recognition
Multimodal Emotion Recognition in Conversations (MERC) enhances emotional understanding through the fusion of multimodal signals. However, unpredictable modality absence in real-world scenarios significantly degrades the performance of existing methods. Conventional missing-modality recovery approaches, which depend on training with complete multimodal data, often suffer from semantic distortion under extreme data distributions, such as fixed-modality absence. To address this, we propose the Federated Dialogue-guided and Semantic-Consistent Diffusion (FedDISC) framework, pioneering the integration of federated learning into missing-modality recovery. By federated aggregation of modality-specific diffusion models trained on clients and broadcasting them to clients missing corresponding modalities, FedDISC overcomes single-client reliance on modality completeness. Additionally, the DISC-Diffusion module ensures consistency in context, speaker identity, and semantics between recovered and available modalities, using a Dialogue Graph Network to capture conversational dependencies and a Semantic Conditioning Network to enforce semantic alignment. We further introduce a novel Alternating Frozen Aggregation strategy, which cyclically freezes recovery and classifier modules to facilitate collaborative optimization. Extensive experiments on the IEMOCAP, CMUMOSI, and CMUMOSEI datasets demonstrate that FedDISC achieves superior emotion classification performance across diverse missing modality patterns, outperforming existing approaches.
title Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2511.00344