Diff-V2M: A Hierarchical Conditional Diffusion Model with Explicit Rhythmic Modeling for Video-to-Music Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Shulei, Wang, Zihao, Yu, Jiaxing, Yang, Xiangyuan, Li, Shuyu, Wu, Songruoyao, Zhang, Kejun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Comprehensive Survey on Generative AI for Video-to-Music Generation
par: Ji, Shulei, et autres
Publié: (2025)
par: Ji, Shulei, et autres
Publié: (2025)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
SongGLM: Lyric-to-Melody Generation with 2D Alignment Encoding and Multi-Task Pre-Training
par: Yu, Jiaxing, et autres
Publié: (2024)
par: Yu, Jiaxing, et autres
Publié: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025)
par: Chen, Xueyuan, et autres
Publié: (2025)
Assessing Data Replication in Symbolic Music via Adapted Structural Similarity Index Measure
par: Ji, Shulei, et autres
Publié: (2025)
par: Ji, Shulei, et autres
Publié: (2025)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
par: Ji, Shulei, et autres
Publié: (2023)
par: Ji, Shulei, et autres
Publié: (2023)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
par: Zhang, Jisi, et autres
Publié: (2025)
par: Zhang, Jisi, et autres
Publié: (2025)
GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models
par: Guinot, Julien, et autres
Publié: (2025)
par: Guinot, Julien, et autres
Publié: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
par: Richter, Julius, et autres
Publié: (2025)
par: Richter, Julius, et autres
Publié: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
par: Zuo, Heda, et autres
Publié: (2025)
par: Zuo, Heda, et autres
Publié: (2025)
Transcribing Rhythmic Patterns of the Guitar Track in Polyphonic Music
par: Lukoianov, Aleksandr, et autres
Publié: (2025)
par: Lukoianov, Aleksandr, et autres
Publié: (2025)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024)
par: Li, Yuke, et autres
Publié: (2024)
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
par: Postolache, Emilian, et autres
Publié: (2024)
par: Postolache, Emilian, et autres
Publié: (2024)
Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models
par: Nistal, Javier, et autres
Publié: (2024)
par: Nistal, Javier, et autres
Publié: (2024)
Diff-ETS: Learning a Diffusion Probabilistic Model for Electromyography-to-Speech Conversion
par: Ren, Zhao, et autres
Publié: (2024)
par: Ren, Zhao, et autres
Publié: (2024)
Language Models for Music Medicine Generation
par: Nikolakakis, Emmanouil, et autres
Publié: (2024)
par: Nikolakakis, Emmanouil, et autres
Publié: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
Music Style Transfer with Time-Varying Inversion of Diffusion Models
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
par: Rouard, Simon, et autres
Publié: (2024)
par: Rouard, Simon, et autres
Publié: (2024)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
par: Comanducci, Luca, et autres
Publié: (2024)
par: Comanducci, Luca, et autres
Publié: (2024)
A Diffusion-Based Generative Equalizer for Music Restoration
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
par: Li, Xiaojie, et autres
Publié: (2025)
par: Li, Xiaojie, et autres
Publié: (2025)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
par: Pina, Leonardo, et autres
Publié: (2024)
par: Pina, Leonardo, et autres
Publié: (2024)
ProGress: Structured Music Generation via Graph Diffusion and Hierarchical Music Analysis
par: Ni-Hahn, Stephen, et autres
Publié: (2025)
par: Ni-Hahn, Stephen, et autres
Publié: (2025)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2024)
par: Tal, Or, et autres
Publié: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
Melodia: Training-Free Music Editing Guided by Attention Probing in Diffusion Models
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models
par: Baoueb, Teysir, et autres
Publié: (2025)
par: Baoueb, Teysir, et autres
Publié: (2025)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
par: Chen, Jiatao, et autres
Publié: (2024)
par: Chen, Jiatao, et autres
Publié: (2024)
Improving Controllability and Editability for Pretrained Text-to-Music Generation Models
par: Zhang, Yixiao
Publié: (2024)
par: Zhang, Yixiao
Publié: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Modeling the Difficulty of Saxophone Music
par: Libřický, Šimon, et autres
Publié: (2025)
par: Libřický, Šimon, et autres
Publié: (2025)
ACE-Step: A Step Towards Music Generation Foundation Model
par: Gong, Junmin, et autres
Publié: (2025)
par: Gong, Junmin, et autres
Publié: (2025)
Documents similaires
-
A Comprehensive Survey on Generative AI for Video-to-Music Generation
par: Ji, Shulei, et autres
Publié: (2025) -
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
par: Li, Sifei, et autres
Publié: (2024) -
SongGLM: Lyric-to-Melody Generation with 2D Alignment Encoding and Multi-Task Pre-Training
par: Yu, Jiaxing, et autres
Publié: (2024) -
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025) -
Assessing Data Replication in Symbolic Music via Adapted Structural Similarity Index Measure
par: Ji, Shulei, et autres
Publié: (2025)