Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rajasekhar, G, Alam, Jahangir |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)
par: Praveen, R. Gnana, et autres
Publié: (2021)
Dynamic Cross Attention for Audio-Visual Person Verification
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2022)
par: Praveen, R. Gnana, et autres
Publié: (2022)
United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space
par: Praveen, R. Gnana, et autres
Publié: (2025)
par: Praveen, R. Gnana, et autres
Publié: (2025)
Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition
par: Cong, Kaixuan, et autres
Publié: (2025)
par: Cong, Kaixuan, et autres
Publié: (2025)
Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition
par: Shi, Tong, et autres
Publié: (2024)
par: Shi, Tong, et autres
Publié: (2024)
Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention
par: R, Joe Dhanith P, et autres
Publié: (2024)
par: R, Joe Dhanith P, et autres
Publié: (2024)
CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition
par: Lee, Jongseo, et autres
Publié: (2025)
par: Lee, Jongseo, et autres
Publié: (2025)
FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder
par: Li, Wei, et autres
Publié: (2026)
par: Li, Wei, et autres
Publié: (2026)
Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
par: Saleh, Mohamed, et autres
Publié: (2026)
par: Saleh, Mohamed, et autres
Publié: (2026)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
par: Liu, Weifeng, et autres
Publié: (2024)
par: Liu, Weifeng, et autres
Publié: (2024)
Ordering Matters: Rank-Aware Selective Fusion for Blended Emotion Recognition
par: Lee, Junghyun, et autres
Publié: (2026)
par: Lee, Junghyun, et autres
Publié: (2026)
Efficient Audio-Visual Fusion for Video Classification
par: Awan, Mahrukh, et autres
Publié: (2024)
par: Awan, Mahrukh, et autres
Publié: (2024)
IMUGPT 2.0: Language-Based Cross Modality Transfer for Sensor-Based Human Activity Recognition
par: Leng, Zikang, et autres
Publié: (2024)
par: Leng, Zikang, et autres
Publié: (2024)
eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
par: Wu, Xuecheng, et autres
Publié: (2025)
par: Wu, Xuecheng, et autres
Publié: (2025)
Local-to-Global Cross-Modal Attention-Aware Fusion for HSI-X Semantic Segmentation
par: Zhang, Xuming, et autres
Publié: (2024)
par: Zhang, Xuming, et autres
Publié: (2024)
Cognitive-Inspired Hierarchical Attention Fusion With Visual and Textual for Cross-Domain Sequential Recommendation
par: Wu, Wangyu, et autres
Publié: (2025)
par: Wu, Wangyu, et autres
Publié: (2025)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Knowledge-Aligned Counterfactual-Enhancement Diffusion Perception for Unsupervised Cross-Domain Visual Emotion Recognition
par: Yin, Wen, et autres
Publié: (2025)
par: Yin, Wen, et autres
Publié: (2025)
Visual Prompting in LLMs for Enhancing Emotion Recognition
par: Zhang, Qixuan, et autres
Publié: (2024)
par: Zhang, Qixuan, et autres
Publié: (2024)
Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling
par: Byeon, Junhyeong, et autres
Publié: (2026)
par: Byeon, Junhyeong, et autres
Publié: (2026)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
par: Shou, Yuntao, et autres
Publié: (2023)
par: Shou, Yuntao, et autres
Publié: (2023)
Cross-Attention Fusion of Visual and Geometric Features for Large Vocabulary Arabic Lipreading
par: Daou, Samar, et autres
Publié: (2024)
par: Daou, Samar, et autres
Publié: (2024)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
par: Astrid, Marcella, et autres
Publié: (2024)
par: Astrid, Marcella, et autres
Publié: (2024)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
par: Liu, Feng, et autres
Publié: (2025)
par: Liu, Feng, et autres
Publié: (2025)
Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations
par: Li, Xinran, et autres
Publié: (2024)
par: Li, Xinran, et autres
Publié: (2024)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
par: Yu, Li, et autres
Publié: (2024)
par: Yu, Li, et autres
Publié: (2024)
Visual and Textual Prompts in VLLMs for Enhancing Emotion Recognition
par: Wang, Zhifeng, et autres
Publié: (2025)
par: Wang, Zhifeng, et autres
Publié: (2025)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
MCN-CL: Multimodal Cross-Attention Network and Contrastive Learning for Multimodal Emotion Recognition
par: Li, Feng, et autres
Publié: (2025)
par: Li, Feng, et autres
Publié: (2025)
Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
par: Luo, Xiwen, et autres
Publié: (2026)
par: Luo, Xiwen, et autres
Publié: (2026)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
par: Li, Xiwen, et autres
Publié: (2025)
par: Li, Xiwen, et autres
Publié: (2025)
Emotic Masked Autoencoder with Attention Fusion for Facial Expression Recognition
par: Nguyen-Xuan, Bach, et autres
Publié: (2024)
par: Nguyen-Xuan, Bach, et autres
Publié: (2024)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
par: Hu, Juewen, et autres
Publié: (2025)
par: Hu, Juewen, et autres
Publié: (2025)
Conflict-Aware Multimodal Fusion for Ambivalence and Hesitancy Recognition
par: Bekhouche, Salah Eddine, et autres
Publié: (2026)
par: Bekhouche, Salah Eddine, et autres
Publié: (2026)
Documents similaires
-
Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024) -
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024) -
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025) -
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
par: Praveen, R. Gnana, et autres
Publié: (2024) -
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)