Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Haoqin, Zhao, Shiwan, Li, Shaokai, Kong, Xiangyu, Wang, Xuechen, Kong, Aobo, Zhou, Jiaming, Chen, Yong, Zeng, Wenjia, Qin, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024)
par: Sun, Haoqin, et autres
Publié: (2024)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024)
par: Wang, Xuechen, et autres
Publié: (2024)
M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
Uncertainty-Aware Mean Opinion Score Prediction
par: Wang, Hui, et autres
Publié: (2024)
par: Wang, Hui, et autres
Publié: (2024)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
par: Wang, Shiyao, et autres
Publié: (2025)
par: Wang, Shiyao, et autres
Publié: (2025)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
par: Li, Sifei, et autres
Publié: (2025)
par: Li, Sifei, et autres
Publié: (2025)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
par: Chou, Huang-Cheng, et autres
Publié: (2024)
par: Chou, Huang-Cheng, et autres
Publié: (2024)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)
par: Kim, Minyoung, et autres
Publié: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
par: Guo, Hongming, et autres
Publié: (2024)
par: Guo, Hongming, et autres
Publié: (2024)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion
par: Sun, Chang, et autres
Publié: (2024)
par: Sun, Chang, et autres
Publié: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
par: Liu, Renhang, et autres
Publié: (2024)
par: Liu, Renhang, et autres
Publié: (2024)
MusicScore: A Dataset for Music Score Modeling and Generation
par: Lin, Yuheng, et autres
Publié: (2024)
par: Lin, Yuheng, et autres
Publié: (2024)
ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
Emotion-Aligned Contrastive Learning Between Images and Music
par: Stewart, Shanti, et autres
Publié: (2023)
par: Stewart, Shanti, et autres
Publié: (2023)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
par: Koh, Junyoung, et autres
Publié: (2025)
par: Koh, Junyoung, et autres
Publié: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2024)
par: Cong, Gaoxiang, et autres
Publié: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
par: Yu, Fan, et autres
Publié: (2024)
par: Yu, Fan, et autres
Publié: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
par: Liu, Qianhui, et autres
Publié: (2024)
par: Liu, Qianhui, et autres
Publié: (2024)
PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
Documents similaires
-
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
par: Sun, Haoqin, et autres
Publié: (2024) -
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
par: Wang, Xuechen, et autres
Publié: (2024) -
M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
par: Zhou, Jiaming, et autres
Publié: (2024) -
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024) -
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)