HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Shan, Sizhe, Li, Qiulin, Cui, Yutao, Yang, Miles, Wang, Yuehai, Yang, Qun, Zhou, Jin, Zhong, Zhao
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866908500026720256
author Shan, Sizhe
Li, Qiulin
Cui, Yutao
Yang, Miles
Wang, Yuehai
Yang, Qun
Zhou, Jin
Zhong, Zhao
author_facet Shan, Sizhe
Li, Qiulin
Cui, Yutao
Yang, Miles
Wang, Yuehai
Yang, Qun
Zhou, Jin
Zhong, Zhao
contents Recent advances in video generation produce visually realistic content, yet the absence of synchronized audio severely compromises immersion. To address key challenges in video-to-audio generation, including multimodal data scarcity, modality imbalance and limited audio quality in existing methods, we propose HunyuanVideo-Foley, an end-to-end text-video-to-audio framework that synthesizes high-fidelity audio precisely aligned with visual dynamics and semantic context. Our approach incorporates three core innovations: (1) a scalable data pipeline curating 100k-hour multimodal datasets through automated annotation; (2) a representation alignment strategy using self-supervised audio features to guide latent diffusion training, efficiently improving audio quality and generation stability; (3) a novel multimodal diffusion transformer resolving modal competition, containing dual-stream audio-video fusion through joint attention, and textual semantic injection via cross-attention. Comprehensive evaluations demonstrate that HunyuanVideo-Foley achieves new state-of-the-art performance across audio fidelity, visual-semantic alignment, temporal alignment and distribution matching. The demo page is available at: https://szczesnys.github.io/hunyuanvideo-foley/.
format Preprint
id arxiv_https___arxiv_org_abs_2508_16930
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
Shan, Sizhe
Li, Qiulin
Cui, Yutao
Yang, Miles
Wang, Yuehai
Yang, Qun
Zhou, Jin
Zhong, Zhao
Audio and Speech Processing
Computer Vision and Pattern Recognition
Sound
Recent advances in video generation produce visually realistic content, yet the absence of synchronized audio severely compromises immersion. To address key challenges in video-to-audio generation, including multimodal data scarcity, modality imbalance and limited audio quality in existing methods, we propose HunyuanVideo-Foley, an end-to-end text-video-to-audio framework that synthesizes high-fidelity audio precisely aligned with visual dynamics and semantic context. Our approach incorporates three core innovations: (1) a scalable data pipeline curating 100k-hour multimodal datasets through automated annotation; (2) a representation alignment strategy using self-supervised audio features to guide latent diffusion training, efficiently improving audio quality and generation stability; (3) a novel multimodal diffusion transformer resolving modal competition, containing dual-stream audio-video fusion through joint attention, and textual semantic injection via cross-attention. Comprehensive evaluations demonstrate that HunyuanVideo-Foley achieves new state-of-the-art performance across audio fidelity, visual-semantic alignment, temporal alignment and distribution matching. The demo page is available at: https://szczesnys.github.io/hunyuanvideo-foley/.
title HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
topic Audio and Speech Processing
Computer Vision and Pattern Recognition
Sound
url https://arxiv.org/abs/2508.16930