Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ying, Shou, Yuntao, Ai, Wei, Meng, Tao, Li, Keqin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GSDNet: Revisiting Incomplete Multimodal-Diffusion from Graph Spectrum Perspective for Conversation Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
Heterogeneous bimodal attention fusion for speech emotion recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
di: Guo, Chengling, et al.
Pubblicazione: (2026)
di: Guo, Chengling, et al.
Pubblicazione: (2026)
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
Graph-based multi-Feature fusion method for speech emotion recognition
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
di: Liu, Xueyu, et al.
Pubblicazione: (2024)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
di: Chen, Jinming, et al.
Pubblicazione: (2025)
di: Chen, Jinming, et al.
Pubblicazione: (2025)
Towards interpretable emotion recognition: Identifying key features with machine learning
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
RaD-Net 2: A causal two-stage repairing and denoising speech enhancement network with knowledge distillation and complex axial self-attention
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
di: Liu, Mingshuai, et al.
Pubblicazione: (2024)
EmoTale: An Enacted Speech-emotion Dataset in Danish
di: Hjuler, Maja J., et al.
Pubblicazione: (2025)
di: Hjuler, Maja J., et al.
Pubblicazione: (2025)
ZIPA: A family of efficient models for multilingual phone recognition
di: Zhu, Jian, et al.
Pubblicazione: (2025)
di: Zhu, Jian, et al.
Pubblicazione: (2025)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
Self-consistent context aware conformer transducer for speech recognition
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
Improving child speech recognition with augmented child-like speech
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
Sparse wavefield reconstruction and denoising with boostlets
di: Zea, Elias, et al.
Pubblicazione: (2025)
di: Zea, Elias, et al.
Pubblicazione: (2025)
Short-term cognitive fatigue of spatial selective attention after face-to-face conversations in virtual noisy environments
di: Hládek, Ľuboš, et al.
Pubblicazione: (2025)
di: Hládek, Ľuboš, et al.
Pubblicazione: (2025)
Convoifilter: A case study of doing cocktail party speech recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
Phoneme-based speech recognition driven by large language models and sampling marginalization
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
di: Kounadis-Bastian, Dionyssos, et al.
Pubblicazione: (2024)
di: Kounadis-Bastian, Dionyssos, et al.
Pubblicazione: (2024)
Exploring the limits of decoder-only models trained on public speech recognition corpora
di: Gupta, Ankit, et al.
Pubblicazione: (2024)
di: Gupta, Ankit, et al.
Pubblicazione: (2024)
asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2026)
di: Shou, Yuntao, et al.
Pubblicazione: (2026)
learning discriminative features from spectrograms using center loss for speech emotion recognition
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
Automatic speech recognition for the Nepali language using CNN, bidirectional LSTM and ResNet
di: Dhakal, Manish, et al.
Pubblicazione: (2024)
di: Dhakal, Manish, et al.
Pubblicazione: (2024)
Versatile audio-visual learning for emotion recognition
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
di: Wright, George August, et al.
Pubblicazione: (2023)
di: Wright, George August, et al.
Pubblicazione: (2023)
High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR
di: Banerjee, Sourav, et al.
Pubblicazione: (2024)
di: Banerjee, Sourav, et al.
Pubblicazione: (2024)
Transfer the linguistic representations from TTS to accent conversion with non-parallel data
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus
di: Chen, Szu-Jui, et al.
Pubblicazione: (2026)
di: Chen, Szu-Jui, et al.
Pubblicazione: (2026)
A corpus-based investigation of pitch contours of monosyllabic words in conversational Taiwan Mandarin
di: Jin, Xiaoyun, et al.
Pubblicazione: (2024)
di: Jin, Xiaoyun, et al.
Pubblicazione: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
Accent conversion using discrete units with parallel data synthesized from controllable accented TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
di: Araiza-Illan, Gloria, et al.
Pubblicazione: (2023)
di: Araiza-Illan, Gloria, et al.
Pubblicazione: (2023)
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
di: Mei, Yuxiang, et al.
Pubblicazione: (2026)
di: Mei, Yuxiang, et al.
Pubblicazione: (2026)
Adjust-free adversarial example generation in speech recognition using evolutionary multi-objective optimization under black-box condition
di: Ishida, Shoma, et al.
Pubblicazione: (2020)
di: Ishida, Shoma, et al.
Pubblicazione: (2020)
Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
MM-KWS: Multi-modal Prompts for Multilingual User-defined Keyword Spotting
di: Ai, Zhiqi, et al.
Pubblicazione: (2024)
di: Ai, Zhiqi, et al.
Pubblicazione: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
GSDNet: Revisiting Incomplete Multimodal-Diffusion from Graph Spectrum Perspective for Conversation Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2025) -
Heterogeneous bimodal attention fusion for speech emotion recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025) -
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
di: Guo, Chengling, et al.
Pubblicazione: (2026) -
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025) -
Graph-based multi-Feature fusion method for speech emotion recognition
di: Liu, Xueyu, et al.
Pubblicazione: (2024)