Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhu, Wentao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
di: Qian, Xinyuan, et al.
Pubblicazione: (2024)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
di: Su, Kun, et al.
Pubblicazione: (2024)
di: Su, Kun, et al.
Pubblicazione: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
Audio-Visual Instance Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
Audio Transformers
di: Verma, Prateek, et al.
Pubblicazione: (2021)
di: Verma, Prateek, et al.
Pubblicazione: (2021)
Deformable Audio Transformer for Audio Event Detection
di: Zhu, Wentao
Pubblicazione: (2023)
di: Zhu, Wentao
Pubblicazione: (2023)
VGGSounder: Audio-Visual Evaluations for Foundation Models
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
di: Zverev, Daniil, et al.
Pubblicazione: (2025)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
Sequential Contrastive Audio-Visual Learning
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
di: Liu, Jinxiang, et al.
Pubblicazione: (2024)
Semantic Grouping Network for Audio Source Separation
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
di: Chen, Gehui, et al.
Pubblicazione: (2025)
di: Chen, Gehui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024) -
Text-to-Audio Generation Synchronized with Videos
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024) -
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)