Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Praveen, R. Gnana, Alam, Jahangir |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Cross Attention for Audio-Visual Person Verification
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024)
par: Praveen, R. Gnana, et autres
Publié: (2024)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space
par: Praveen, R. Gnana, et autres
Publié: (2025)
par: Praveen, R. Gnana, et autres
Publié: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)
par: Praveen, R. Gnana, et autres
Publié: (2021)
A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2022)
par: Praveen, R. Gnana, et autres
Publié: (2022)
Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
par: Shou, Yuntao, et autres
Publié: (2023)
par: Shou, Yuntao, et autres
Publié: (2023)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
par: Low, Chetwin, et autres
Publié: (2025)
par: Low, Chetwin, et autres
Publié: (2025)
Benchmarking Cross-Domain Audio-Visual Deception Detection
par: Guo, Xiaobao, et autres
Publié: (2024)
par: Guo, Xiaobao, et autres
Publié: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
par: Kwon, Mingi, et autres
Publié: (2025)
par: Kwon, Mingi, et autres
Publié: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
par: Yu, RunLin, et autres
Publié: (2024)
par: Yu, RunLin, et autres
Publié: (2024)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024)
par: Xiao, Zhenyuan, et autres
Publié: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
par: Rouditchenko, Andrew, et autres
Publié: (2024)
par: Rouditchenko, Andrew, et autres
Publié: (2024)
Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
par: Korbar, Bruno, et autres
Publié: (2024)
par: Korbar, Bruno, et autres
Publié: (2024)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
par: Berghi, Davide, et autres
Publié: (2024)
par: Berghi, Davide, et autres
Publié: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
par: Lai, Yung-Hsuan, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
par: Juanola, Xavier, et autres
Publié: (2024)
par: Juanola, Xavier, et autres
Publié: (2024)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
par: Li, Yidi, et autres
Publié: (2024)
par: Li, Yidi, et autres
Publié: (2024)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
par: Pegg, Samuel, et autres
Publié: (2023)
par: Pegg, Samuel, et autres
Publié: (2023)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
par: Wu, Renjie, et autres
Publié: (2023)
par: Wu, Renjie, et autres
Publié: (2023)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
Documents similaires
-
Dynamic Cross Attention for Audio-Visual Person Verification
par: Praveen, R. Gnana, et autres
Publié: (2024) -
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2024) -
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025) -
United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space
par: Praveen, R. Gnana, et autres
Publié: (2025) -
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
par: Praveen, R. Gnana, et autres
Publié: (2021)