Yin, Y., Li, X., Shan, Y., & Zou, Y. (2023). AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild.
Chicago Style (17th ed.) CitationYin, Yongkang, Xu Li, Ying Shan, and Yuexian Zou. AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild. 2023.
MLA (9th ed.) CitationYin, Yongkang, et al. AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild. 2023.
Warning: These citations may not always be 100% accurate.