Exploring Multilingual Unseen Speaker Emotion Recognition: Leveraging Co-Attention Cues in Multitask Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Goel, Arnav, Hira, Medha, Gupta, Anubha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
di: Goel, Arnav, et al.
Pubblicazione: (2024)
di: Goel, Arnav, et al.
Pubblicazione: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
di: Hira, Medha, et al.
Pubblicazione: (2024)
di: Hira, Medha, et al.
Pubblicazione: (2024)
Efficient Compression of Multitask Multilingual Speech Models
di: Ferraz, Thomas Palmeira
Pubblicazione: (2024)
di: Ferraz, Thomas Palmeira
Pubblicazione: (2024)
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
di: Sharma, Swati, et al.
Pubblicazione: (2026)
di: Sharma, Swati, et al.
Pubblicazione: (2026)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2024)
di: Khaertdinov, Bulat, et al.
Pubblicazione: (2024)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
di: Wang, Kexue, et al.
Pubblicazione: (2026)
di: Wang, Kexue, et al.
Pubblicazione: (2026)
Leveraging Label Potential for Enhanced Multimodal Emotion Recognition
di: Shao, Xuechun, et al.
Pubblicazione: (2025)
di: Shao, Xuechun, et al.
Pubblicazione: (2025)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
di: Lee, HyeYoung, et al.
Pubblicazione: (2025)
di: Lee, HyeYoung, et al.
Pubblicazione: (2025)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
di: Vu, Tai
Pubblicazione: (2025)
di: Vu, Tai
Pubblicazione: (2025)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
di: Thebaud, Thomas, et al.
Pubblicazione: (2025)
di: Thebaud, Thomas, et al.
Pubblicazione: (2025)
Leveraging Contrastive Learning and Self-Training for Multimodal Emotion Recognition with Limited Labeled Samples
di: Fan, Qi, et al.
Pubblicazione: (2024)
di: Fan, Qi, et al.
Pubblicazione: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
di: Alvarez-Trejos, Juan Ignacio, et al.
Pubblicazione: (2024)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
di: Wang, Cong, et al.
Pubblicazione: (2025)
di: Wang, Cong, et al.
Pubblicazione: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
di: Saengthong, Phurich, et al.
Pubblicazione: (2025)
di: Saengthong, Phurich, et al.
Pubblicazione: (2025)
Certification of Speaker Recognition Models to Additive Perturbations
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
di: Korzh, Dmitrii, et al.
Pubblicazione: (2024)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2024)
Towards Attention-based Contrastive Learning for Audio Spoof Detection
di: Goel, Chirag, et al.
Pubblicazione: (2024)
di: Goel, Chirag, et al.
Pubblicazione: (2024)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
di: Jiao, Xinxin, et al.
Pubblicazione: (2024)
di: Jiao, Xinxin, et al.
Pubblicazione: (2024)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
Color-based Emotion Representation for Speech Emotion Recognition
di: Nagase, Ryotaro, et al.
Pubblicazione: (2026)
di: Nagase, Ryotaro, et al.
Pubblicazione: (2026)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
di: Jafarzadeh, Pourya, et al.
Pubblicazione: (2024)
di: Jafarzadeh, Pourya, et al.
Pubblicazione: (2024)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
di: Kim, Byunggun, et al.
Pubblicazione: (2024)
di: Kim, Byunggun, et al.
Pubblicazione: (2024)
Semi-Supervised Self-Learning Enhanced Music Emotion Recognition
di: Sun, Yifu, et al.
Pubblicazione: (2024)
di: Sun, Yifu, et al.
Pubblicazione: (2024)
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
di: Guo, Chengling, et al.
Pubblicazione: (2026)
di: Guo, Chengling, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
di: Goel, Arnav, et al.
Pubblicazione: (2024) -
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
di: Hira, Medha, et al.
Pubblicazione: (2024) -
Efficient Compression of Multitask Multilingual Speech Models
di: Ferraz, Thomas Palmeira
Pubblicazione: (2024) -
Task-Lens: Cross-Task Utility Based Speech Dataset Profiling for Low-Resource Indian Languages
di: Sharma, Swati, et al.
Pubblicazione: (2026) -
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)