Controllable Video-to-Music Generation with Multiple Time-Varying Conditions

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wu, Junxian, You, Weitao, Zuo, Heda, Zhang, Dengming, Chen, Pei, Sun, Lingyun
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866912505120423936
author Wu, Junxian
You, Weitao
Zuo, Heda
Zhang, Dengming
Chen, Pei
Sun, Lingyun
author_facet Wu, Junxian
You, Weitao
Zuo, Heda
Zhang, Dengming
Chen, Pei
Sun, Lingyun
contents Music enhances video narratives and emotions, driving demand for automatic video-to-music (V2M) generation. However, existing V2M methods relying solely on visual features or supplementary textual inputs generate music in a black-box manner, often failing to meet user expectations. To address this challenge, we propose a novel multi-condition guided V2M generation framework that incorporates multiple time-varying conditions for enhanced control over music generation. Our method uses a two-stage training strategy that enables learning of V2M fundamentals and audiovisual temporal synchronization while meeting users' needs for multi-condition control. In the first stage, we introduce a fine-grained feature selection module and a progressive temporal alignment attention mechanism to ensure flexible feature alignment. For the second stage, we develop a dynamic conditional fusion module and a control-guided decoder module to integrate multiple conditions and accurately guide the music composition process. Extensive experiments demonstrate that our method outperforms existing V2M pipelines in both subjective and objective evaluations, significantly enhancing control and alignment with user expectations.
format Preprint
id arxiv_https___arxiv_org_abs_2507_20627
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
Wu, Junxian
You, Weitao
Zuo, Heda
Zhang, Dengming
Chen, Pei
Sun, Lingyun
Multimedia
Artificial Intelligence
Sound
Audio and Speech Processing
Music enhances video narratives and emotions, driving demand for automatic video-to-music (V2M) generation. However, existing V2M methods relying solely on visual features or supplementary textual inputs generate music in a black-box manner, often failing to meet user expectations. To address this challenge, we propose a novel multi-condition guided V2M generation framework that incorporates multiple time-varying conditions for enhanced control over music generation. Our method uses a two-stage training strategy that enables learning of V2M fundamentals and audiovisual temporal synchronization while meeting users' needs for multi-condition control. In the first stage, we introduce a fine-grained feature selection module and a progressive temporal alignment attention mechanism to ensure flexible feature alignment. For the second stage, we develop a dynamic conditional fusion module and a control-guided decoder module to integrate multiple conditions and accurately guide the music composition process. Extensive experiments demonstrate that our method outperforms existing V2M pipelines in both subjective and objective evaluations, significantly enhancing control and alignment with user expectations.
title Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
topic Multimedia
Artificial Intelligence
Sound
Audio and Speech Processing
url https://arxiv.org/abs/2507.20627