Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Deng, Zeyu, Lu, Yanhui, Liao, Jiashu, Wu, Shuang, Wei, Chongfeng
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866916868259840000
author Deng, Zeyu
Lu, Yanhui
Liao, Jiashu
Wu, Shuang
Wei, Chongfeng
author_facet Deng, Zeyu
Lu, Yanhui
Liao, Jiashu
Wu, Shuang
Wei, Chongfeng
contents Multimodal emotion recognition (MER) is crucial for enabling emotionally intelligent systems that perceive and respond to human emotions. However, existing methods suffer from limited cross-modal interaction and imbalanced contributions across modalities. To address these issues, we propose Sync-TVA, an end-to-end graph-attention framework featuring modality-specific dynamic enhancement and structured cross-modal fusion. Our design incorporates a dynamic enhancement module for each modality and constructs heterogeneous cross-modal graphs to model semantic relations across text, audio, and visual features. A cross-attention fusion mechanism further aligns multimodal cues for robust emotion inference. Experiments on MELD and IEMOCAP demonstrate consistent improvements over state-of-the-art models in both accuracy and weighted F1 score, especially under class-imbalanced conditions.
format Preprint
id arxiv_https___arxiv_org_abs_2507_21395
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
Deng, Zeyu
Lu, Yanhui
Liao, Jiashu
Wu, Shuang
Wei, Chongfeng
Multimedia
Artificial Intelligence
Sound
Audio and Speech Processing
Multimodal emotion recognition (MER) is crucial for enabling emotionally intelligent systems that perceive and respond to human emotions. However, existing methods suffer from limited cross-modal interaction and imbalanced contributions across modalities. To address these issues, we propose Sync-TVA, an end-to-end graph-attention framework featuring modality-specific dynamic enhancement and structured cross-modal fusion. Our design incorporates a dynamic enhancement module for each modality and constructs heterogeneous cross-modal graphs to model semantic relations across text, audio, and visual features. A cross-attention fusion mechanism further aligns multimodal cues for robust emotion inference. Experiments on MELD and IEMOCAP demonstrate consistent improvements over state-of-the-art models in both accuracy and weighted F1 score, especially under class-imbalanced conditions.
title Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
topic Multimedia
Artificial Intelligence
Sound
Audio and Speech Processing
url https://arxiv.org/abs/2507.21395