Improving Speech Emotion Recognition Through Cross Modal Attention Alignment and Balanced Stacking Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ueda, Lucas, Lima, João, Marques, Leonardo, Costa, Paula |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
par: Costa, Federico, et autres
Publié: (2024)
par: Costa, Federico, et autres
Publié: (2024)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
par: Zhao, Yan, et autres
Publié: (2024)
par: Zhao, Yan, et autres
Publié: (2024)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
par: Shen, Siyuan, et autres
Publié: (2024)
par: Shen, Siyuan, et autres
Publié: (2024)
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models
par: Derington, Anna, et autres
Publié: (2023)
par: Derington, Anna, et autres
Publié: (2023)
Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition
par: Zhao, Ruoyu, et autres
Publié: (2025)
par: Zhao, Ruoyu, et autres
Publié: (2025)
Mouth Articulation-Based Anchoring for Improved Cross-Corpus Speech Emotion Recognition
par: Upadhyay, Shreya G., et autres
Publié: (2024)
par: Upadhyay, Shreya G., et autres
Publié: (2024)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
par: Wan, Zixiang, et autres
Publié: (2024)
par: Wan, Zixiang, et autres
Publié: (2024)
THAI Speech Emotion Recognition (THAI-SER) corpus
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
par: Wongpithayadisai, Jilamika, et autres
Publié: (2025)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
par: Tang, Haobin, et autres
Publié: (2024)
par: Tang, Haobin, et autres
Publié: (2024)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
par: Corrêa, Pedro, et autres
Publié: (2025)
par: Corrêa, Pedro, et autres
Publié: (2025)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
PARROT: Synergizing Mamba and Attention-based SSL Pre-Trained Models via Parallel Branch Hadamard Optimal Transport for Speech Emotion Recognition
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
par: Wang, Xincheng, et autres
Publié: (2024)
par: Wang, Xincheng, et autres
Publié: (2024)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
par: Bukhari, Hazim, et autres
Publié: (2024)
par: Bukhari, Hazim, et autres
Publié: (2024)
Exploring Local Interpretable Model-Agnostic Explanations for Speech Emotion Recognition with Distribution-Shift
par: Hjuler, Maja J., et autres
Publié: (2025)
par: Hjuler, Maja J., et autres
Publié: (2025)
SelfTTS: cross-speaker style transfer through explicit embedding disentanglement and self-refinement using self-augmentation
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
par: Li, Pengcheng, et autres
Publié: (2025)
par: Li, Pengcheng, et autres
Publié: (2025)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition
par: Dutta, Soumya, et autres
Publié: (2023)
par: Dutta, Soumya, et autres
Publié: (2023)
Machine Unlearning in Speech Emotion Recognition via Forget Set Alone
par: Ren, Zhao, et autres
Publié: (2025)
par: Ren, Zhao, et autres
Publié: (2025)
Enhancing Speech Emotion Recognition Through Differentiable Architecture Search
par: Rajapakshe, Thejan, et autres
Publié: (2023)
par: Rajapakshe, Thejan, et autres
Publié: (2023)
PEFT-SER: On the Use of Parameter Efficient Transfer Learning Approaches For Speech Emotion Recognition Using Pre-trained Speech Models
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
par: Lee, HyeYoung, et autres
Publié: (2025)
par: Lee, HyeYoung, et autres
Publié: (2025)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
par: Gao, Yuan, et autres
Publié: (2025)
par: Gao, Yuan, et autres
Publié: (2025)
Token-Level Logits Matter: A Closer Look at Speech Foundation Models for Ambiguous Emotion Recognition
par: Halim, Jule Valendo, et autres
Publié: (2025)
par: Halim, Jule Valendo, et autres
Publié: (2025)
Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
par: Zhao, Jiaqi, et autres
Publié: (2024)
par: Zhao, Jiaqi, et autres
Publié: (2024)
TBDM-Net: Bidirectional Dense Networks with Gender Information for Speech Emotion Recognition
par: Striletchi, Vlad, et autres
Publié: (2024)
par: Striletchi, Vlad, et autres
Publié: (2024)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
More Similar than Dissimilar: Modeling Annotators for Cross-Corpus Speech Emotion Recognition
par: Tavernor, James, et autres
Publié: (2025)
par: Tavernor, James, et autres
Publié: (2025)
Documents similaires
-
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
par: Ueda, Lucas H., et autres
Publié: (2026) -
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026) -
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
par: Costa, Federico, et autres
Publié: (2024) -
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
par: Zhao, Yan, et autres
Publié: (2024) -
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
par: Wu, Haibin, et autres
Publié: (2024)