Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shendabadi, Ali, Izadirad, Parnia, Salehi, Mostafa, Bijankhan, Mahmoud |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
par: Lee, Junseok, et autres
Publié: (2026)
par: Lee, Junseok, et autres
Publié: (2026)
WhisperD: Dementia Speech Recognition and Filler Word Detection with Whisper
par: Akinrintoyo, Emmanuel, et autres
Publié: (2025)
par: Akinrintoyo, Emmanuel, et autres
Publié: (2025)
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
par: Gheffari, Youcef Soufiane, et autres
Publié: (2026)
par: Gheffari, Youcef Soufiane, et autres
Publié: (2026)
Whisper-GPT: A Hybrid Representation Audio Large Language Model
par: Verma, Prateek
Publié: (2024)
par: Verma, Prateek
Publié: (2024)
Adapting Whisper for Parameter-efficient Code-Switching Speech Recognition via Soft Prompt Tuning
par: Yang, Hongli, et autres
Publié: (2025)
par: Yang, Hongli, et autres
Publié: (2025)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
Query-by-Example Keyword Spotting Using Spectral-Temporal Graph Attentive Pooling and Multi-Task Learning
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Color-based Emotion Representation for Speech Emotion Recognition
par: Nagase, Ryotaro, et autres
Publié: (2026)
par: Nagase, Ryotaro, et autres
Publié: (2026)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
par: Vu, Tai
Publié: (2025)
par: Vu, Tai
Publié: (2025)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction
par: Yang, Cheng-Yeh, et autres
Publié: (2025)
par: Yang, Cheng-Yeh, et autres
Publié: (2025)
Leveraging Whisper Embeddings for Audio-based Lyrics Matching
par: Mancini, Eleonora, et autres
Publié: (2025)
par: Mancini, Eleonora, et autres
Publié: (2025)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Early Attentive Sparsification Accelerates Neural Speech Transcription
par: Xu, Zifei, et autres
Publié: (2025)
par: Xu, Zifei, et autres
Publié: (2025)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
par: Yang, Chenchen, et autres
Publié: (2026)
par: Yang, Chenchen, et autres
Publié: (2026)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
par: Hyeon, Jonghwan, et autres
Publié: (2024)
par: Hyeon, Jonghwan, et autres
Publié: (2024)
Speech Emotion Recognition with Distilled Prosodic and Linguistic Affect Representations
par: Shome, Debaditya, et autres
Publié: (2023)
par: Shome, Debaditya, et autres
Publié: (2023)
SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech
par: R, Aron, et autres
Publié: (2024)
par: R, Aron, et autres
Publié: (2024)
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
Quantization for OpenAI's Whisper Models: A Comparative Analysis
par: Andreyev, Allison
Publié: (2025)
par: Andreyev, Allison
Publié: (2025)
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
BaldWhisper: Faster Whisper with Head Shearing and Layer Merging
par: Sy, Yaya, et autres
Publié: (2025)
par: Sy, Yaya, et autres
Publié: (2025)
Exploring Multilingual Unseen Speaker Emotion Recognition: Leveraging Co-Attention Cues in Multitask Learning
par: Goel, Arnav, et autres
Publié: (2024)
par: Goel, Arnav, et autres
Publié: (2024)
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
par: Bataev, Vladimir
Publié: (2025)
par: Bataev, Vladimir
Publié: (2025)
Arabic Little STT: Arabic Children Speech Recognition Dataset
par: Alkadri, Mouhand, et autres
Publié: (2025)
par: Alkadri, Mouhand, et autres
Publié: (2025)
Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild
par: Durmus, Berkin, et autres
Publié: (2026)
par: Durmus, Berkin, et autres
Publié: (2026)
Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition
par: Vesterbacka, Leonora, et autres
Publié: (2025)
par: Vesterbacka, Leonora, et autres
Publié: (2025)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
par: Khaertdinov, Bulat, et autres
Publié: (2024)
par: Khaertdinov, Bulat, et autres
Publié: (2024)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
par: Rufai, Amina Mardiyyah, et autres
Publié: (2020)
Morse Code-Enabled Speech Recognition for Individuals with Visual and Hearing Impairments
par: Choudhury, Ritabrata Roy
Publié: (2024)
par: Choudhury, Ritabrata Roy
Publié: (2024)
Towards the Next Frontier in Speech Representation Learning Using Disentanglement
par: Krishna, Varun, et autres
Publié: (2024)
par: Krishna, Varun, et autres
Publié: (2024)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba
par: Mohammad, Baher, et autres
Publié: (2025)
par: Mohammad, Baher, et autres
Publié: (2025)
Documents similaires
-
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023) -
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
par: Lee, Junseok, et autres
Publié: (2026) -
WhisperD: Dementia Speech Recognition and Filler Word Detection with Whisper
par: Akinrintoyo, Emmanuel, et autres
Publié: (2025) -
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
par: Gheffari, Youcef Soufiane, et autres
Publié: (2026) -
Whisper-GPT: A Hybrid Representation Audio Large Language Model
par: Verma, Prateek
Publié: (2024)