Adapting WavLM for Speech Emotion Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Diatlova, Daria, Udalov, Anton, Shutov, Vitalii, Spirin, Egor |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection
par: Stourbe, Theophile, et autres
Publié: (2024)
par: Stourbe, Theophile, et autres
Publié: (2024)
Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM
par: Sun, Zhaokai, et autres
Publié: (2025)
par: Sun, Zhaokai, et autres
Publié: (2025)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
par: Nakazawa, Kazushi
Publié: (2026)
par: Nakazawa, Kazushi
Publié: (2026)
Domain Adapting Deep Reinforcement Learning for Real-world Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2022)
par: Rajapakshe, Thejan, et autres
Publié: (2022)
XWSB: A Blend System Utilizing XLS-R and WavLM with SLS Classifier detection system for SVDD 2024 Challenge
par: Zhang, Qishan, et autres
Publié: (2024)
par: Zhang, Qishan, et autres
Publié: (2024)
Over-the-air White-box Attack on the Wav2Vec Speech Recognition Neural Network
par: Alexey, Protopopov
Publié: (2026)
par: Alexey, Protopopov
Publié: (2026)
Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation
par: Ruggiero, Giuseppe, et autres
Publié: (2025)
par: Ruggiero, Giuseppe, et autres
Publié: (2025)
Optimal Transport Maps are Good Voice Converters
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Test-Time Adaptation for Speech Emotion Recognition
par: Dong, Jiaheng, et autres
Publié: (2026)
par: Dong, Jiaheng, et autres
Publié: (2026)
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications
par: Wee, Marcus Yu Zhe, et autres
Publié: (2025)
par: Wee, Marcus Yu Zhe, et autres
Publié: (2025)
Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation
par: Lashkarashvili, Nineli, et autres
Publié: (2024)
par: Lashkarashvili, Nineli, et autres
Publié: (2024)
Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
par: Rajapakshe, Thejan, et autres
Publié: (2023)
par: Rajapakshe, Thejan, et autres
Publié: (2023)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
par: Ulgen, Ismail Rasim, et autres
Publié: (2024)
Representation Learning with Parameterised Quantum Circuits for Advancing Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2025)
par: Rajapakshe, Thejan, et autres
Publié: (2025)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
par: Chen, Chengxin, et autres
Publié: (2024)
par: Chen, Chengxin, et autres
Publié: (2024)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
par: Zhang, Fan, et autres
Publié: (2023)
par: Zhang, Fan, et autres
Publié: (2023)
NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech
par: Borisov, Maksim, et autres
Publié: (2025)
par: Borisov, Maksim, et autres
Publié: (2025)
A Layer-Anchoring Strategy for Enhancing Cross-Lingual Speech Emotion Recognition
par: Upadhyay, Shreya G., et autres
Publié: (2024)
par: Upadhyay, Shreya G., et autres
Publié: (2024)
Mouth Articulation-Based Anchoring for Improved Cross-Corpus Speech Emotion Recognition
par: Upadhyay, Shreya G., et autres
Publié: (2024)
par: Upadhyay, Shreya G., et autres
Publié: (2024)
Enhancing Speech Emotion Recognition using Dynamic Spectral Features and Kalman Smoothing
par: Hizabri, Marouane El, et autres
Publié: (2026)
par: Hizabri, Marouane El, et autres
Publié: (2026)
Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation
par: Lu, Cheng, et autres
Publié: (2024)
par: Lu, Cheng, et autres
Publié: (2024)
Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion Recognition
par: Ma, Yujian, et autres
Publié: (2025)
par: Ma, Yujian, et autres
Publié: (2025)
More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition
par: Tavernor, James, et autres
Publié: (2025)
par: Tavernor, James, et autres
Publié: (2025)
Coverage-Guaranteed Speech Emotion Recognition via Calibrated Uncertainty-Adaptive Prediction Sets
par: Jia, Zijun, et autres
Publié: (2025)
par: Jia, Zijun, et autres
Publié: (2025)
WavLM model ensemble for audio deepfake detection
par: Combei, David, et autres
Publié: (2024)
par: Combei, David, et autres
Publié: (2024)
CPT-Boosted Wav2vec2.0: Towards Noise Robust Speech Recognition for Classroom Environments
par: Attia, Ahmed Adel, et autres
Publié: (2024)
par: Attia, Ahmed Adel, et autres
Publié: (2024)
emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2024)
par: Rajapakshe, Thejan, et autres
Publié: (2024)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
par: Nagpal, Chirag, et autres
Publié: (2024)
par: Nagpal, Chirag, et autres
Publié: (2024)
Speaker Emotion Recognition: Leveraging Self-Supervised Models for Feature Extraction Using Wav2Vec2 and HuBERT
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
par: Jafarzadeh, Pourya, et autres
Publié: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
par: Lin, Jingru, et autres
Publié: (2024)
par: Lin, Jingru, et autres
Publié: (2024)
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
par: Rong, Xiaobin, et autres
Publié: (2025)
par: Rong, Xiaobin, et autres
Publié: (2025)
Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration
par: Sun, Esther, et autres
Publié: (2026)
par: Sun, Esther, et autres
Publié: (2026)
UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching
par: Glazer, Neta, et autres
Publié: (2025)
par: Glazer, Neta, et autres
Publié: (2025)
WavInWav: Time-domain Speech Hiding via Invertible Neural Network
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
Multi-blank Transducers for Speech Recognition
par: Xu, Hainan, et autres
Publié: (2022)
par: Xu, Hainan, et autres
Publié: (2022)
Pre-Finetuning for Few-Shot Emotional Speech Recognition
par: Chen, Maximillian, et autres
Publié: (2023)
par: Chen, Maximillian, et autres
Publié: (2023)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
par: Jiang, Xilin, et autres
Publié: (2024)
par: Jiang, Xilin, et autres
Publié: (2024)
Keyword-Guided Adaptation of Automatic Speech Recognition
par: Shamsian, Aviv, et autres
Publié: (2024)
par: Shamsian, Aviv, et autres
Publié: (2024)
Drax: Speech Recognition with Discrete Flow Matching
par: Navon, Aviv, et autres
Publié: (2025)
par: Navon, Aviv, et autres
Publié: (2025)
Documents similaires
-
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection
par: Stourbe, Theophile, et autres
Publié: (2024) -
Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM
par: Sun, Zhaokai, et autres
Publié: (2025) -
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
par: Nakazawa, Kazushi
Publié: (2026) -
Domain Adapting Deep Reinforcement Learning for Real-world Speech Emotion Recognition
par: Rajapakshe, Thejan, et autres
Publié: (2022) -
XWSB: A Blend System Utilizing XLS-R and WavLM with SLS Classifier detection system for SVDD 2024 Challenge
par: Zhang, Qishan, et autres
Publié: (2024)