Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Siriwardhana, Shamane, Reis, Andrew, Weerasekera, Rivindu, Nanayakkara, Suranga |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022)
par: Yoon, Ji Won, et autres
Publié: (2022)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024)
par: Saliba, Alexandra, et autres
Publié: (2024)
Fine-tune the Entire RAG Architecture (including DPR retriever) for Question-Answering
par: Siriwardhana, Shamane, et autres
Publié: (2021)
par: Siriwardhana, Shamane, et autres
Publié: (2021)
JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
par: Cha, Jun-Hyeok, et autres
Publié: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Improving Speech-based Emotion Recognition with Contextual Utterance Analysis and LLMs
par: Zhang, Enshi, et autres
Publié: (2024)
par: Zhang, Enshi, et autres
Publié: (2024)
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
par: minjie, Xiang
Publié: (2024)
par: minjie, Xiang
Publié: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
Braille-to-Speech Generator: Audio Generation Based on Joint Fine-Tuning of CLIP and Fastspeech2
par: Xu, Chun, et autres
Publié: (2024)
par: Xu, Chun, et autres
Publié: (2024)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
par: Jiang, Liuyuan, et autres
Publié: (2025)
par: Jiang, Liuyuan, et autres
Publié: (2025)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
par: Shayaninasab, Minoo, et autres
Publié: (2024)
par: Shayaninasab, Minoo, et autres
Publié: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
par: Combei, David
Publié: (2025)
par: Combei, David
Publié: (2025)
Self-Supervised Syllable Discovery Based on Speaker-Disentangled HuBERT
par: Komatsu, Ryota, et autres
Publié: (2024)
par: Komatsu, Ryota, et autres
Publié: (2024)
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
par: Wang, Honghong, et autres
Publié: (2025)
par: Wang, Honghong, et autres
Publié: (2025)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
par: Shekoufandeh, Golshid, et autres
Publié: (2025)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
par: Phukan, Orchid Chetia, et autres
Publié: (2024)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
par: Khaertdinov, Bulat, et autres
Publié: (2024)
par: Khaertdinov, Bulat, et autres
Publié: (2024)
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
par: Zhang, Zixing, et autres
Publié: (2024)
par: Zhang, Zixing, et autres
Publié: (2024)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
par: Xu, Tianyi, et autres
Publié: (2025)
par: Xu, Tianyi, et autres
Publié: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
Interface Design for Self-Supervised Speech Models
par: Shih, Yi-Jen, et autres
Publié: (2024)
par: Shih, Yi-Jen, et autres
Publié: (2024)
Vesper: A Compact and Effective Pretrained Model for Speech Emotion Recognition
par: Chen, Weidong, et autres
Publié: (2023)
par: Chen, Weidong, et autres
Publié: (2023)
BERSting at the Screams: A Benchmark for Distanced, Emotional and Shouted Speech Recognition
par: Tuttösí, Paige, et autres
Publié: (2025)
par: Tuttösí, Paige, et autres
Publié: (2025)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
par: Shao, Hang, et autres
Publié: (2023)
par: Shao, Hang, et autres
Publié: (2023)
Improving Code Switching with Supervised Fine Tuning and GELU Adapters
par: Pham, Linh
Publié: (2025)
par: Pham, Linh
Publié: (2025)
Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
par: Kutsakov, Aleksandr, et autres
Publié: (2025)
Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
par: Bijoy, Mehedi Hasan, et autres
Publié: (2025)
Speaker-Aware Simulation Improves Conversational Speech Recognition
par: Gedeon, Máté, et autres
Publié: (2026)
par: Gedeon, Máté, et autres
Publié: (2026)
VHASR: A Multimodal Speech Recognition System With Vision Hotwords
par: Hu, Jiliang, et autres
Publié: (2024)
par: Hu, Jiliang, et autres
Publié: (2024)
Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment
par: Wang, Ke, et autres
Publié: (2025)
par: Wang, Ke, et autres
Publié: (2025)
Documents similaires
-
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
par: Yoon, Ji Won, et autres
Publié: (2022) -
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
par: Saliba, Alexandra, et autres
Publié: (2024) -
Fine-tune the Entire RAG Architecture (including DPR retriever) for Question-Answering
par: Siriwardhana, Shamane, et autres
Publié: (2021) -
JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis
par: Cha, Jun-Hyeok, et autres
Publié: (2025) -
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)