Deep Learning for Speech Emotion Recognition: A CNN Approach Utilizing Mel Spectrograms
Fuente:
arXiv
Guardado en:
| Autor principal: | Penumajji, Niketa |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
por: Meng, Yigang
Publicado: (2024)
por: Meng, Yigang
Publicado: (2024)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025)
por: Shao, Nian, et al.
Publicado: (2025)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024)
por: Hu, Guoqiang, et al.
Publicado: (2024)
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
por: Gheffari, Youcef Soufiane, et al.
Publicado: (2026)
por: Gheffari, Youcef Soufiane, et al.
Publicado: (2026)
Graph Embedding with Mel-spectrograms for Underwater Acoustic Target Recognition
por: Feng, Sheng, et al.
Publicado: (2025)
por: Feng, Sheng, et al.
Publicado: (2025)
Cross-Cultural Bias in Mel-Scale Representations: Evidence and Alternatives from Speech and Music
por: Chauhan, Shivam, et al.
Publicado: (2026)
por: Chauhan, Shivam, et al.
Publicado: (2026)
Enhanced Speech Emotion Recognition with Efficient Channel Attention Guided Deep CNN-BiLSTM Framework
por: Kundu, Niloy Kumar, et al.
Publicado: (2024)
por: Kundu, Niloy Kumar, et al.
Publicado: (2024)
Speech Emotion Recognition via Entropy-Aware Score Selection
por: Chua, ChenYi, et al.
Publicado: (2025)
por: Chua, ChenYi, et al.
Publicado: (2025)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
por: Kim, Byunggun, et al.
Publicado: (2024)
por: Kim, Byunggun, et al.
Publicado: (2024)
Speech Emotion Recognition Using CNN and Its Use Case in Digital Healthcare
por: Nigar, Nishargo
Publicado: (2024)
por: Nigar, Nishargo
Publicado: (2024)
Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
por: Vu, Tai
Publicado: (2025)
por: Vu, Tai
Publicado: (2025)
Color-based Emotion Representation for Speech Emotion Recognition
por: Nagase, Ryotaro, et al.
Publicado: (2026)
por: Nagase, Ryotaro, et al.
Publicado: (2026)
MERaLiON-SER: Robust Speech Emotion Recognition Model for English and SEA Languages
por: Sailor, Hardik B., et al.
Publicado: (2025)
por: Sailor, Hardik B., et al.
Publicado: (2025)
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)
por: Bai, Richard He, et al.
Publicado: (2024)
Enhancing Quranic Learning: A Multimodal Deep Learning Approach for Arabic Phoneme Recognition
por: Kucukmanisa, Ayhan, et al.
Publicado: (2025)
por: Kucukmanisa, Ayhan, et al.
Publicado: (2025)
Unifying EEG and Speech for Emotion Recognition: A Two-Step Joint Learning Framework for Handling Missing EEG Data During Inference
por: Tiwari, Upasana, et al.
Publicado: (2025)
por: Tiwari, Upasana, et al.
Publicado: (2025)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
por: Shi, Jiacheng, et al.
Publicado: (2025)
por: Shi, Jiacheng, et al.
Publicado: (2025)
PTS-SNN: A Prompt-Tuned Temporal Shift Spiking Neural Networks for Efficient Speech Emotion Recognition
por: Su, Xun, et al.
Publicado: (2026)
por: Su, Xun, et al.
Publicado: (2026)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
por: Lee, HyeYoung, et al.
Publicado: (2025)
por: Lee, HyeYoung, et al.
Publicado: (2025)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
por: Li, Dongyuan, et al.
Publicado: (2024)
por: Li, Dongyuan, et al.
Publicado: (2024)
Are you sure? Analysing Uncertainty Quantification Approaches for Real-world Speech Emotion Recognition
por: Schrüfer, Oliver, et al.
Publicado: (2024)
por: Schrüfer, Oliver, et al.
Publicado: (2024)
Chord Recognition with Deep Learning
por: Mackenzie, Pierre
Publicado: (2025)
por: Mackenzie, Pierre
Publicado: (2025)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
por: Shayaninasab, Minoo, et al.
Publicado: (2024)
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
por: Kheddar, Hamza, et al.
Publicado: (2024)
por: Kheddar, Hamza, et al.
Publicado: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024)
por: Guo, Hongming, et al.
Publicado: (2024)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
por: Sampath, Aneesha, et al.
Publicado: (2025)
por: Sampath, Aneesha, et al.
Publicado: (2025)
Quantum Kernels for Audio Deepfake Detection Using Spectrogram Patch Features
por: Amin, Lisan Al, et al.
Publicado: (2026)
por: Amin, Lisan Al, et al.
Publicado: (2026)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
por: Hyeon, Jonghwan, et al.
Publicado: (2024)
por: Hyeon, Jonghwan, et al.
Publicado: (2024)
Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation
por: Chang, Yi, et al.
Publicado: (2024)
por: Chang, Yi, et al.
Publicado: (2024)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
por: Pan, Yu, et al.
Publicado: (2023)
por: Pan, Yu, et al.
Publicado: (2023)
Enabling Automatic Disordered Speech Recognition: An Impaired Speech Dataset in the Akan Language
por: Wiafe, Isaac, et al.
Publicado: (2026)
por: Wiafe, Isaac, et al.
Publicado: (2026)
Transfer Learning-Based Deep Residual Learning for Speech Recognition in Clean and Noisy Environments
por: Djeffal, Noussaiba, et al.
Publicado: (2025)
por: Djeffal, Noussaiba, et al.
Publicado: (2025)
Ejemplares similares
-
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
por: Meng, Yigang
Publicado: (2024) -
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025) -
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024) -
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
por: Gheffari, Youcef Soufiane, et al.
Publicado: (2026) -
Graph Embedding with Mel-spectrograms for Underwater Acoustic Target Recognition
por: Feng, Sheng, et al.
Publicado: (2025)