Graph-based multi-Feature fusion method for speech emotion recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xueyu, Lin, Jie, Wang, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Heterogeneous bimodal attention fusion for speech emotion recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025)
Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025)
Fusion approaches for emotion recognition from speech using acoustic and text-based features
di: Pepino, Leonardo, et al.
Pubblicazione: (2024)
di: Pepino, Leonardo, et al.
Pubblicazione: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)
Language model integration based on memory control for sequence to sequence speech recognition
di: Cho, Jaejin, et al.
Pubblicazione: (2018)
di: Cho, Jaejin, et al.
Pubblicazione: (2018)
Phoneme-based speech recognition driven by large language models and sampling marginalization
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus
di: Chen, Szu-Jui, et al.
Pubblicazione: (2026)
di: Chen, Szu-Jui, et al.
Pubblicazione: (2026)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
di: Ducorroy, Alexandre, et al.
Pubblicazione: (2025)
learning discriminative features from spectrograms using center loss for speech emotion recognition
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
di: Dai, Dongyang, et al.
Pubblicazione: (2025)
Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition
di: Liu, Ying, et al.
Pubblicazione: (2026)
di: Liu, Ying, et al.
Pubblicazione: (2026)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
di: Chen, Jinming, et al.
Pubblicazione: (2025)
di: Chen, Jinming, et al.
Pubblicazione: (2025)
A vector quantized masked autoencoder for audiovisual speech emotion recognition
di: Sadok, Samir, et al.
Pubblicazione: (2023)
di: Sadok, Samir, et al.
Pubblicazione: (2023)
Towards interpretable emotion recognition: Identifying key features with machine learning
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
di: Kaloga, Yacouba, et al.
Pubblicazione: (2025)
PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
Single-channel speech enhancement by using psychoacoustical model inspired fusion framework
di: Samui, Suman
Pubblicazione: (2022)
di: Samui, Suman
Pubblicazione: (2022)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
di: Zhang, Yiru, et al.
Pubblicazione: (2025)
Improving child speech recognition with augmented child-like speech
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
di: Jeong, Jaeseok, et al.
Pubblicazione: (2025)
Enhancing CTC-based speech recognition with diverse modeling units
di: Han, Shiyi, et al.
Pubblicazione: (2024)
di: Han, Shiyi, et al.
Pubblicazione: (2024)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
SPGM: Prioritizing Local Features for enhanced speech separation performance
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
di: Yip, Jia Qi, et al.
Pubblicazione: (2023)
Zipformer: A faster and better encoder for automatic speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
CR-CTC: Consistency regularization on CTC for improved speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
di: Yao, Zengwei, et al.
Pubblicazione: (2024)
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
di: Li, Xuyuan, et al.
Pubblicazione: (2023)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
WhisperFlow: speech foundation models in real time
di: Wang, Rongxiang, et al.
Pubblicazione: (2024)
di: Wang, Rongxiang, et al.
Pubblicazione: (2024)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
di: Gong, Rong, et al.
Pubblicazione: (2024)
di: Gong, Rong, et al.
Pubblicazione: (2024)
Omni-directional attention mechanism based on Mamba for speech separation
di: Xue, Ke, et al.
Pubblicazione: (2026)
di: Xue, Ke, et al.
Pubblicazione: (2026)
A lightweight and robust method for blind wideband-to-fullband extension of speech
di: Büthe, Jan, et al.
Pubblicazione: (2024)
di: Büthe, Jan, et al.
Pubblicazione: (2024)
An automatic mixing speech enhancement system for multi-track audio
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
di: Liu, Xiaojing, et al.
Pubblicazione: (2024)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
di: Kounadis-Bastian, Dionyssos, et al.
Pubblicazione: (2024)
di: Kounadis-Bastian, Dionyssos, et al.
Pubblicazione: (2024)
Can Whisper perform speech-based in-context learning?
di: Wang, Siyin, et al.
Pubblicazione: (2023)
di: Wang, Siyin, et al.
Pubblicazione: (2023)
Versatile audio-visual learning for emotion recognition
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
Self-consistent context aware conformer transducer for speech recognition
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Heterogeneous bimodal attention fusion for speech emotion recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025) -
Explainable speech emotion recognition through attentive pooling: insights from attention-based temporal localization
di: Leygue, Tahitoa, et al.
Pubblicazione: (2025) -
Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2025) -
Fusion approaches for emotion recognition from speech using acoustic and text-based features
di: Pepino, Leonardo, et al.
Pubblicazione: (2024) -
Late fusion ensembles for speech recognition on diverse input audio representations
di: Jezidžić, Marin, et al.
Pubblicazione: (2024)