Modality-Invariant Bidirectional Temporal Representation Distillation Network for Missing Multimodal Sentiment Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xincheng, Wang, Liejun, Yu, Yinfeng, Jiao, Xinxin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
par: Jiao, Xinxin, et autres
Publié: (2024)
par: Jiao, Xinxin, et autres
Publié: (2024)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
par: Wang, Xincheng, et autres
Publié: (2024)
par: Wang, Xincheng, et autres
Publié: (2024)
Leveraging Label Potential for Enhanced Multimodal Emotion Recognition
par: Shao, Xuechun, et autres
Publié: (2025)
par: Shao, Xuechun, et autres
Publié: (2025)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
par: Wang, Kexue, et autres
Publié: (2026)
par: Wang, Kexue, et autres
Publié: (2026)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
par: Cao, Yubing, et autres
Publié: (2025)
par: Cao, Yubing, et autres
Publié: (2025)
Magnitude-Phase Dual-Path Speech Enhancement Network based on Self-Supervised Embedding and Perceptual Contrast Stretch Boosting
par: Mattursun, Alimjan, et autres
Publié: (2025)
par: Mattursun, Alimjan, et autres
Publié: (2025)
Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach
par: Liu, Weide, et autres
Publié: (2023)
par: Liu, Weide, et autres
Publié: (2023)
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
par: Zhu, Tianheng, et autres
Publié: (2025)
par: Zhu, Tianheng, et autres
Publié: (2025)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
par: Zhu, Tao, et autres
Publié: (2025)
par: Zhu, Tao, et autres
Publié: (2025)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
par: Zhao, Ya, et autres
Publié: (2026)
par: Zhao, Ya, et autres
Publié: (2026)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
par: Ahasan, Md Mubtasim, et autres
Publié: (2024)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
par: Zhou, Xinyu, et autres
Publié: (2026)
par: Zhou, Xinyu, et autres
Publié: (2026)
Spatial-Aware Conditioned Fusion for Audio-Visual Navigation
par: Wu, Shaohang, et autres
Publié: (2026)
par: Wu, Shaohang, et autres
Publié: (2026)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
par: Liu, Teng, et autres
Publié: (2026)
par: Liu, Teng, et autres
Publié: (2026)
Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
par: Qiang, Chunyu, et autres
Publié: (2024)
par: Qiang, Chunyu, et autres
Publié: (2024)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
par: Wang, Qiaolin, et autres
Publié: (2025)
par: Wang, Qiaolin, et autres
Publié: (2025)
BSS-CFFMA: Cross-Domain Feature Fusion and Multi-Attention Speech Enhancement Network based on Self-Supervised Embedding
par: Mattursun, Alimjan, et autres
Publié: (2024)
par: Mattursun, Alimjan, et autres
Publié: (2024)
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement
par: Zheng, Tao, et autres
Publié: (2024)
par: Zheng, Tao, et autres
Publié: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
VNet: A GAN-based Multi-Tier Discriminator Network for Speech Synthesis Vocoders
par: Cao, Yubing, et autres
Publié: (2024)
par: Cao, Yubing, et autres
Publié: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge
par: Xie, Yuankun, et autres
Publié: (2024)
par: Xie, Yuankun, et autres
Publié: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Classifier-Guided Captioning Across Modalities
par: Shaulov, Ariel, et autres
Publié: (2025)
par: Shaulov, Ariel, et autres
Publié: (2025)
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
par: Wang, Yang, et autres
Publié: (2023)
par: Wang, Yang, et autres
Publié: (2023)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
par: Lu, Xugang, et autres
Publié: (2024)
par: Lu, Xugang, et autres
Publié: (2024)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
par: Jo, Daejin, et autres
Publié: (2025)
par: Jo, Daejin, et autres
Publié: (2025)
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings
par: Zhu, Yonggang, et autres
Publié: (2026)
par: Zhu, Yonggang, et autres
Publié: (2026)
WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction
par: Emon, Jakaria Islam, et autres
Publié: (2025)
par: Emon, Jakaria Islam, et autres
Publié: (2025)
Query-by-Example Keyword Spotting Using Spectral-Temporal Graph Attentive Pooling and Multi-Task Learning
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023)
par: Zhong, Jinzuomu, et autres
Publié: (2023)
Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
par: Lee, Jaeyoung, et autres
Publié: (2026)
par: Lee, Jaeyoung, et autres
Publié: (2026)
Temporal Information Reconstruction and Non-Aligned Residual in Spiking Neural Networks for Speech Classification
par: Zhang, Qi, et autres
Publié: (2024)
par: Zhang, Qi, et autres
Publié: (2024)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
par: Yan, Canxiang, et autres
Publié: (2025)
par: Yan, Canxiang, et autres
Publié: (2025)
Data-Centric Improvements for Enhancing Multi-Modal Understanding in Spoken Conversation Modeling
par: Chen, Maximillian, et autres
Publié: (2024)
par: Chen, Maximillian, et autres
Publié: (2024)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
par: Ali, Abdelrahman A., et autres
Publié: (2024)
par: Ali, Abdelrahman A., et autres
Publié: (2024)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
Documents similaires
-
MFHCA: Enhancing Speech Emotion Recognition Via Multi-Spatial Fusion and Hierarchical Cooperative Attention
par: Jiao, Xinxin, et autres
Publié: (2024) -
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
par: Wang, Xincheng, et autres
Publié: (2024) -
Leveraging Label Potential for Enhanced Multimodal Emotion Recognition
par: Shao, Xuechun, et autres
Publié: (2025) -
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
par: Wang, Kexue, et autres
Publié: (2026) -
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
par: Cao, Yubing, et autres
Publié: (2025)