DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Peiyuan, Liu, Yao, Liu, Qiao, Zhang, Zongshun, Yang, Jiaye, Liu, Lu, Yao, Daibing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
di: Cheng, Zebang, et al.
Pubblicazione: (2024)
Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning
di: Zhao, Fuzheng, et al.
Pubblicazione: (2024)
di: Zhao, Fuzheng, et al.
Pubblicazione: (2024)
A Survey on Multimodal Music Emotion Recognition
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
di: Deng, Zeyu, et al.
Pubblicazione: (2025)
di: Deng, Zeyu, et al.
Pubblicazione: (2025)
Digit Recognition using Multimodal Spiking Neural Networks
di: Bjorndahl, William, et al.
Pubblicazione: (2024)
di: Bjorndahl, William, et al.
Pubblicazione: (2024)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Audio-Vision Contrastive Learning for Phonological Class Recognition
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
MCDubber: Multimodal Context-Aware Expressive Video Dubbing
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
di: Zhao, Yuan, et al.
Pubblicazione: (2024)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
di: Chi, Xiaowei, et al.
Pubblicazione: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
AMuSE: Adaptive Multimodal Analysis for Speaker Emotion Recognition in Group Conversations
di: Devulapally, Naresh Kumar, et al.
Pubblicazione: (2024)
di: Devulapally, Naresh Kumar, et al.
Pubblicazione: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
di: Wang, Baisen, et al.
Pubblicazione: (2024)
di: Wang, Baisen, et al.
Pubblicazione: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
di: Gu, Ke, et al.
Pubblicazione: (2025)
di: Gu, Ke, et al.
Pubblicazione: (2025)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
di: Pan, Yu, et al.
Pubblicazione: (2023)
di: Pan, Yu, et al.
Pubblicazione: (2023)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
di: Yao, Dong, et al.
Pubblicazione: (2023)
di: Yao, Dong, et al.
Pubblicazione: (2023)
Learning Musical Representations for Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
di: Cui, Meng, et al.
Pubblicazione: (2023)
di: Cui, Meng, et al.
Pubblicazione: (2023)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
di: He, Jiajun, et al.
Pubblicazione: (2024)
di: He, Jiajun, et al.
Pubblicazione: (2024)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
di: Li, Yue, et al.
Pubblicazione: (2024)
di: Li, Yue, et al.
Pubblicazione: (2024)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition
di: Cheng, Zebang, et al.
Pubblicazione: (2024) -
Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning
di: Zhao, Fuzheng, et al.
Pubblicazione: (2024) -
A Survey on Multimodal Music Emotion Recognition
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025) -
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024) -
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
di: Li, Feng, et al.
Pubblicazione: (2024)