Huang, X., Zhou, H., Yang, Q., Wen, S., & Han, K. (2025). JoVA: Unified Multimodal Learning for Joint Video-Audio Generation.
Chicago Style (17th ed.) CitationHuang, Xiaohu, Hao Zhou, Qiangpeng Yang, Shilei Wen, and Kai Han. JoVA: Unified Multimodal Learning for Joint Video-Audio Generation. 2025.
MLA (9th ed.) CitationHuang, Xiaohu, et al. JoVA: Unified Multimodal Learning for Joint Video-Audio Generation. 2025.
Warning: These citations may not always be 100% accurate.