Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
Fuente:
arXiv
Guardado en:
| Autor principal: | Zhu, Wentao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
por: Zhu, Wentao
Publicado: (2024)
por: Zhu, Wentao
Publicado: (2024)
Text-to-Audio Generation Synchronized with Videos
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
por: Hashmi, Ammarah, et al.
Publicado: (2023)
por: Hashmi, Ammarah, et al.
Publicado: (2023)
Unified Video-Language Pre-training with Synchronized Audio
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
por: Fernandez, Antonio, et al.
Publicado: (2024)
por: Fernandez, Antonio, et al.
Publicado: (2024)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2025)
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
por: Joo, Seohyun, et al.
Publicado: (2026)
por: Joo, Seohyun, et al.
Publicado: (2026)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
por: Chen, Mingfei, et al.
Publicado: (2025)
por: Chen, Mingfei, et al.
Publicado: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
por: Xie, Liuyue, et al.
Publicado: (2025)
por: Xie, Liuyue, et al.
Publicado: (2025)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
por: Fang, Pengjun, et al.
Publicado: (2026)
por: Fang, Pengjun, et al.
Publicado: (2026)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
por: Sha, Xuanmeng, et al.
Publicado: (2024)
por: Sha, Xuanmeng, et al.
Publicado: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2026)
por: Zhou, Jinxing, et al.
Publicado: (2026)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
por: Liang, Yingshan, et al.
Publicado: (2025)
por: Liang, Yingshan, et al.
Publicado: (2025)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
por: Choi, Hahyeon, et al.
Publicado: (2025)
por: Choi, Hahyeon, et al.
Publicado: (2025)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
por: Yang, Ruihan, et al.
Publicado: (2023)
por: Yang, Ruihan, et al.
Publicado: (2023)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2025)
por: Lee, Junwon, et al.
Publicado: (2025)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
por: Marinoni, Christian, et al.
Publicado: (2025)
por: Marinoni, Christian, et al.
Publicado: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
por: Yang, Shiqi, et al.
Publicado: (2024)
por: Yang, Shiqi, et al.
Publicado: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
por: Hayakawa, Akio, et al.
Publicado: (2024)
por: Hayakawa, Akio, et al.
Publicado: (2024)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
por: Kang, Minjae, et al.
Publicado: (2025)
por: Kang, Minjae, et al.
Publicado: (2025)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
por: Dai, Yusheng, et al.
Publicado: (2024)
por: Dai, Yusheng, et al.
Publicado: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
por: Tian, Zeyue, et al.
Publicado: (2025)
por: Tian, Zeyue, et al.
Publicado: (2025)
VGGSounder: Audio-Visual Evaluations for Foundation Models
por: Zverev, Daniil, et al.
Publicado: (2025)
por: Zverev, Daniil, et al.
Publicado: (2025)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
por: Su, Kun, et al.
Publicado: (2024)
por: Su, Kun, et al.
Publicado: (2024)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
por: Chen, Gehui, et al.
Publicado: (2025)
por: Chen, Gehui, et al.
Publicado: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
por: Liu, Jinxiang, et al.
Publicado: (2024)
por: Liu, Jinxiang, et al.
Publicado: (2024)
Audio-Visual Instance Segmentation
por: Guo, Ruohao, et al.
Publicado: (2023)
por: Guo, Ruohao, et al.
Publicado: (2023)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
por: Fu, Youquan, et al.
Publicado: (2025)
por: Fu, Youquan, et al.
Publicado: (2025)
Continual Audio-Visual Sound Separation
por: Pian, Weiguo, et al.
Publicado: (2024)
por: Pian, Weiguo, et al.
Publicado: (2024)
Sequential Contrastive Audio-Visual Learning
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
Semantic Grouping Network for Audio Source Separation
por: Mo, Shentong, et al.
Publicado: (2024)
por: Mo, Shentong, et al.
Publicado: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024)
por: Li, Tingle, et al.
Publicado: (2024)
Ejemplares similares
-
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
por: Zhu, Wentao
Publicado: (2024) -
Text-to-Audio Generation Synchronized with Videos
por: Mo, Shentong, et al.
Publicado: (2024) -
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
por: Hashmi, Ammarah, et al.
Publicado: (2023) -
Unified Video-Language Pre-training with Synchronized Audio
por: Mo, Shentong, et al.
Publicado: (2024) -
Multimodal Sentiment Analysis based on Video and Audio Inputs
por: Fernandez, Antonio, et al.
Publicado: (2024)