Xing, Y., He, Y., Tian, Z., Wang, X., & Chen, Q. (2024). Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners.
Chicago Style (17th ed.) CitationXing, Yazhou, Yingqing He, Zeyue Tian, Xintao Wang, and Qifeng Chen. Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners. 2024.
MLA (9th ed.) CitationXing, Yazhou, et al. Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners. 2024.
Warning: These citations may not always be 100% accurate.