V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yan-Bo, Casebeer, Jonah, Mai, Long, Mahapatra, Aniruddha, Bertasius, Gedas, Bryan, Nicholas J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
DRAGON: Distributional Rewards Optimize Diffusion Generative Models
di: Bai, Yatong, et al.
Pubblicazione: (2025)
di: Bai, Yatong, et al.
Pubblicazione: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
di: Jeyaraj, Rathinaraja, et al.
Pubblicazione: (2025)
Stemphonic: All-at-once Flexible Multi-stem Music Generation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2026)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2026)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
Video-based Music Generation
di: Sulun, Serkan
Pubblicazione: (2026)
di: Sulun, Serkan
Pubblicazione: (2026)
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
di: Liao, Junchao, et al.
Pubblicazione: (2026)
di: Liao, Junchao, et al.
Pubblicazione: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
Towards Practical Real-Time Low-Latency Music Source Separation
di: Wu, Junyu, et al.
Pubblicazione: (2025)
di: Wu, Junyu, et al.
Pubblicazione: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
V2Meow: Meowing to the Visual Beat via Video-to-Music Generation
di: Su, Kun, et al.
Pubblicazione: (2023)
di: Su, Kun, et al.
Pubblicazione: (2023)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
di: Zhu, Jian, et al.
Pubblicazione: (2026)
di: Zhu, Jian, et al.
Pubblicazione: (2026)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Temporally Aligned Audio for Video with Autoregression
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
MDD: A Dataset for Text-and-Music Conditioned Duet Dance Generation
di: Gupta, Prerit, et al.
Pubblicazione: (2025)
di: Gupta, Prerit, et al.
Pubblicazione: (2025)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
di: Yu, RunLin, et al.
Pubblicazione: (2024)
di: Yu, RunLin, et al.
Pubblicazione: (2024)
Emotion-Aligned Contrastive Learning Between Images and Music
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
di: Wu, Junxian, et al.
Pubblicazione: (2025)
di: Wu, Junxian, et al.
Pubblicazione: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
DanceEditor: Towards Iterative Editable Music-driven Dance Generation with Open-Vocabulary Descriptions
di: Zhang, Hengyuan, et al.
Pubblicazione: (2025)
di: Zhang, Hengyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024) -
DRAGON: Distributional Rewards Optimize Diffusion Generative Models
di: Bai, Yatong, et al.
Pubblicazione: (2025) -
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025) -
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025) -
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)