Bimodal Connection Attention Fusion for Speech Emotion Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Jiachen, Phan, Huy, Wang, Lin, Reiss, Joshua D. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
par: Sun, Yujia, et autres
Publié: (2024)
par: Sun, Yujia, et autres
Publié: (2024)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
par: Radhakrishnan, Srijith, et autres
Publié: (2023)
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation
par: Xie, Zhifei, et autres
Publié: (2026)
par: Xie, Zhifei, et autres
Publié: (2026)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
par: Li, Feng, et autres
Publié: (2024)
par: Li, Feng, et autres
Publié: (2024)
Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis
par: Ye, Zhen, et autres
Publié: (2025)
par: Ye, Zhen, et autres
Publié: (2025)
When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation
par: Min, Anna, et autres
Publié: (2025)
par: Min, Anna, et autres
Publié: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
par: Shahin, Mostafa, et autres
Publié: (2025)
par: Shahin, Mostafa, et autres
Publié: (2025)
Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
par: Guan, Yiwen, et autres
Publié: (2025)
par: Guan, Yiwen, et autres
Publié: (2025)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
par: Jiang, Peiyuan, et autres
Publié: (2025)
par: Jiang, Peiyuan, et autres
Publié: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Audio-FLAN: A Preliminary Release
par: Xue, Liumeng, et autres
Publié: (2025)
par: Xue, Liumeng, et autres
Publié: (2025)
UniSLU: Unified Spoken Language Understanding from Heterogeneous Cross-Task Datasets
par: Sheng, Zhichao, et autres
Publié: (2025)
par: Sheng, Zhichao, et autres
Publié: (2025)
OpenMU: Your Swiss Army Knife for Music Understanding
par: Zhao, Mengjie, et autres
Publié: (2024)
par: Zhao, Mengjie, et autres
Publié: (2024)
Cross-Modal Learning for Music-to-Music-Video Description Generation
par: Mao, Zhuoyuan, et autres
Publié: (2025)
par: Mao, Zhuoyuan, et autres
Publié: (2025)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
par: Deng, Zihao, et autres
Publié: (2023)
par: Deng, Zihao, et autres
Publié: (2023)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
par: Mao, Zhuoyuan, et autres
Publié: (2025)
par: Mao, Zhuoyuan, et autres
Publié: (2025)
FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
par: Chen, Jianyi, et autres
Publié: (2024)
par: Chen, Jianyi, et autres
Publié: (2024)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
par: Ning, Jinzhong, et autres
Publié: (2025)
par: Ning, Jinzhong, et autres
Publié: (2025)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
par: Xie, Tianxin, et autres
Publié: (2024)
par: Xie, Tianxin, et autres
Publié: (2024)
Documents similaires
-
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026) -
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
par: Ma, Ziyang, et autres
Publié: (2024) -
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025) -
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025) -
Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
par: Li, Yuanchao, et autres
Publié: (2024)