Cross-Modal Binary Attention: An Energy-Efficient Fusion Framework for Audio-Visual Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Saleh, Mohamed, Ahmadi, Zahra |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2024)
por: Mu, Zhaoxi, et al.
Publicado: (2024)
Sequential Contrastive Audio-Visual Learning
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026)
por: Yang, Jianxuan, et al.
Publicado: (2026)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
por: Dai, Yusheng, et al.
Publicado: (2024)
por: Dai, Yusheng, et al.
Publicado: (2024)
Audio-Visual Instance Segmentation
por: Guo, Ruohao, et al.
Publicado: (2023)
por: Guo, Ruohao, et al.
Publicado: (2023)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
por: Low, Chetwin, et al.
Publicado: (2025)
por: Low, Chetwin, et al.
Publicado: (2025)
Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization
por: Guo, Yuxin, et al.
Publicado: (2024)
por: Guo, Yuxin, et al.
Publicado: (2024)
Continual Audio-Visual Sound Separation
por: Pian, Weiguo, et al.
Publicado: (2024)
por: Pian, Weiguo, et al.
Publicado: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
por: Tian, Zeyue, et al.
Publicado: (2025)
por: Tian, Zeyue, et al.
Publicado: (2025)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
por: Yang, Ruihan, et al.
Publicado: (2023)
por: Yang, Ruihan, et al.
Publicado: (2023)
Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification
por: Farhadipour, Aref, et al.
Publicado: (2024)
por: Farhadipour, Aref, et al.
Publicado: (2024)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
por: Su, Kun, et al.
Publicado: (2024)
por: Su, Kun, et al.
Publicado: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024)
por: Li, Tingle, et al.
Publicado: (2024)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
por: Yang, Shiqi, et al.
Publicado: (2024)
por: Yang, Shiqi, et al.
Publicado: (2024)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
por: Li, Kai, et al.
Publicado: (2023)
por: Li, Kai, et al.
Publicado: (2023)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
por: Tian, Zeyue, et al.
Publicado: (2024)
por: Tian, Zeyue, et al.
Publicado: (2024)
Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning
por: Singh, Nikhil, et al.
Publicado: (2023)
por: Singh, Nikhil, et al.
Publicado: (2023)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
por: Wang, Yaoting, et al.
Publicado: (2023)
por: Wang, Yaoting, et al.
Publicado: (2023)
Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation
por: Li, Kexin, et al.
Publicado: (2024)
por: Li, Kexin, et al.
Publicado: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
por: Hayakawa, Akio, et al.
Publicado: (2024)
por: Hayakawa, Akio, et al.
Publicado: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
por: Rinaldi, Ivan, et al.
Publicado: (2026)
por: Rinaldi, Ivan, et al.
Publicado: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
por: Jiang, Zhonghua, et al.
Publicado: (2025)
por: Jiang, Zhonghua, et al.
Publicado: (2025)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
por: Park, Jeongkyun, et al.
Publicado: (2023)
por: Park, Jeongkyun, et al.
Publicado: (2023)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
por: Li, Wenrui, et al.
Publicado: (2024)
por: Li, Wenrui, et al.
Publicado: (2024)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
por: Su, Yaofeng, et al.
Publicado: (2026)
por: Su, Yaofeng, et al.
Publicado: (2026)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
por: Wang, Jiahua, et al.
Publicado: (2025)
por: Wang, Jiahua, et al.
Publicado: (2025)
Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification
por: Selvakumar, Anith, et al.
Publicado: (2023)
por: Selvakumar, Anith, et al.
Publicado: (2023)
Audio-visual Generalized Zero-shot Learning the Easy Way
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
SonoWorld: From One Image to a 3D Audio-Visual Scene
por: Jin, Derong, et al.
Publicado: (2026)
por: Jin, Derong, et al.
Publicado: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
Ejemplares similares
-
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025) -
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2024) -
Sequential Contrastive Audio-Visual Learning
por: Tsiamas, Ioannis, et al.
Publicado: (2024) -
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026) -
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)