Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gheffari, Youcef Soufiane, Benouddane, Oussama Mustapha, Silarbi, Samiya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Arabic Little STT: Arabic Children Speech Recognition Dataset
par: Alkadri, Mouhand, et autres
Publié: (2025)
par: Alkadri, Mouhand, et autres
Publié: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition
par: Chakrabarty, Sudip, et autres
Publié: (2025)
par: Chakrabarty, Sudip, et autres
Publié: (2025)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
par: Vu, Tai
Publié: (2025)
par: Vu, Tai
Publié: (2025)
Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods
par: Shendabadi, Ali, et autres
Publié: (2026)
par: Shendabadi, Ali, et autres
Publié: (2026)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
WESR: Scaling and Evaluating Word-level Event-Speech Recognition
par: Yang, Chenchen, et autres
Publié: (2026)
par: Yang, Chenchen, et autres
Publié: (2026)
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild
par: Durmus, Berkin, et autres
Publié: (2026)
par: Durmus, Berkin, et autres
Publié: (2026)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
par: Azad, Asif, et autres
Publié: (2026)
par: Azad, Asif, et autres
Publié: (2026)
ArabEmoNet: A Lightweight Hybrid 2D CNN-BiLSTM Model with Attention for Robust Arabic Speech Emotion Recognition
par: Abouzeid, Ali, et autres
Publié: (2025)
par: Abouzeid, Ali, et autres
Publié: (2025)
Exploring Self-Supervised Multi-view Contrastive Learning for Speech Emotion Recognition with Limited Annotations
par: Khaertdinov, Bulat, et autres
Publié: (2024)
par: Khaertdinov, Bulat, et autres
Publié: (2024)
Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition
par: Wang, Peng, et autres
Publié: (2026)
par: Wang, Peng, et autres
Publié: (2026)
ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition
par: Lee, Junseok, et autres
Publié: (2026)
par: Lee, Junseok, et autres
Publié: (2026)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
par: Toyin, Hawau Olamide, et autres
Publié: (2025)
par: Toyin, Hawau Olamide, et autres
Publié: (2025)
Deep Learning for Speech Emotion Recognition: A CNN Approach Utilizing Mel Spectrograms
par: Penumajji, Niketa
Publié: (2025)
par: Penumajji, Niketa
Publié: (2025)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
par: Siriwardhana, Shamane, et autres
Publié: (2020)
par: Siriwardhana, Shamane, et autres
Publié: (2020)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
par: Ginjala, Srishti, et autres
Publié: (2026)
par: Ginjala, Srishti, et autres
Publié: (2026)
TSPC: A Two-Stage Phoneme-Centric Architecture for code-switching Vietnamese-English Speech Recognition
par: Anh, Tran Nguyen, et autres
Publié: (2025)
par: Anh, Tran Nguyen, et autres
Publié: (2025)
Searching for Effective Preprocessing Method and CNN-based Architecture with Efficient Channel Attention on Speech Emotion Recognition
par: Kim, Byunggun, et autres
Publié: (2024)
par: Kim, Byunggun, et autres
Publié: (2024)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024)
par: Han, Zhichen, et autres
Publié: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models
par: Dietrich, Juergen
Publié: (2026)
par: Dietrich, Juergen
Publié: (2026)
Efficient Streaming LLM for Speech Recognition
par: Jia, Junteng, et autres
Publié: (2024)
par: Jia, Junteng, et autres
Publié: (2024)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
par: Liu, Ruohan, et autres
Publié: (2026)
par: Liu, Ruohan, et autres
Publié: (2026)
Dual Information Speech Language Models for Emotional Conversations
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
par: Saengthong, Phurich, et autres
Publié: (2025)
par: Saengthong, Phurich, et autres
Publié: (2025)
Raon-Speech Technical Report
par: Kim, Beomsoo, et autres
Publié: (2026)
par: Kim, Beomsoo, et autres
Publié: (2026)
Luganda Speech Intent Recognition for IoT Applications
par: Katumba, Andrew, et autres
Publié: (2024)
par: Katumba, Andrew, et autres
Publié: (2024)
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
par: Sudarshan, Ankitha, et autres
Publié: (2023)
par: Sudarshan, Ankitha, et autres
Publié: (2023)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
Adapting Foundation Speech Recognition Models to Impaired Speech: A Semantic Re-chaining Approach for Personalization of German Speech
par: Pokel, Niclas, et autres
Publié: (2025)
par: Pokel, Niclas, et autres
Publié: (2025)
Story2MIDI: Emotionally Aligned Music Generation from Text
par: Shokri, Mohammad, et autres
Publié: (2025)
par: Shokri, Mohammad, et autres
Publié: (2025)
Efficient Training for Cross-lingual Speech Language Models
par: Zhou, Yan, et autres
Publié: (2026)
par: Zhou, Yan, et autres
Publié: (2026)
Cross-Attention is Half Explanation in Speech-to-Text Models
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
Soundwave: Less is More for Speech-Text Alignment in LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
Documents similaires
-
Arabic Little STT: Arabic Children Speech Recognition Dataset
par: Alkadri, Mouhand, et autres
Publié: (2025) -
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023) -
Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition
par: Chakrabarty, Sudip, et autres
Publié: (2025) -
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026) -
Amplifying Emotional Signals: Data-Efficient Deep Learning for Robust Speech Emotion Recognition
par: Vu, Tai
Publié: (2025)