Text-to-Audio Generation Synchronized with Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Mo, Shentong, Shi, Jing, Tian, Yapeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semantic Grouping Network for Audio Source Separation
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
Audio-visual Generalized Zero-shot Learning the Easy Way
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Multi-scale Multi-instance Visual Sound Localization and Segmentation
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
di: Liang, Yingshan, et al.
Pubblicazione: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2023)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
AudioX: A Unified Framework for Anything-to-Audio Generation
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
Multimodal Sentiment Analysis based on Video and Audio Inputs
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
di: Fernandez, Antonio, et al.
Pubblicazione: (2024)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
di: Sha, Xuanmeng, et al.
Pubblicazione: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
di: Zhou, Jinxing, et al.
Pubblicazione: (2026)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
di: Kang, Minjae, et al.
Pubblicazione: (2025)
di: Kang, Minjae, et al.
Pubblicazione: (2025)
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
di: Su, Kun, et al.
Pubblicazione: (2024)
di: Su, Kun, et al.
Pubblicazione: (2024)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2024)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2024)
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
Audio-Visual Instance Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Semantic Grouping Network for Audio Source Separation
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
Unified Video-Language Pre-training with Synchronized Audio
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024) -
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024) -
Audio-visual Generalized Zero-shot Learning the Easy Way
di: Mo, Shentong, et al.
Pubblicazione: (2024)