Ye, Q., Yu, Z., Shao, R., Xie, X., Torr, P., & Cao, X. (2024). CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios.
Chicago Style (17th ed.) CitationYe, Qilang, Zitong Yu, Rui Shao, Xinyu Xie, Philip Torr, and Xiaochun Cao. CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios. 2024.
MLA (9th ed.) CitationYe, Qilang, et al. CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios. 2024.
Warning: These citations may not always be 100% accurate.