Royer, A., Böhle, M., de Marmiesse, G., Mazaré, L., Zeghidour, N., Défossez, A., & Pérez, P. (2025). Vision-Speech Models: Teaching Speech Models to Converse about Images.
Chicago Style (17th ed.) CitationRoyer, Amélie, Moritz Böhle, Gabriel de Marmiesse, Laurent Mazaré, Neil Zeghidour, Alexandre Défossez, and Patrick Pérez. Vision-Speech Models: Teaching Speech Models to Converse About Images. 2025.
MLA (9th ed.) CitationRoyer, Amélie, et al. Vision-Speech Models: Teaching Speech Models to Converse About Images. 2025.
Warning: These citations may not always be 100% accurate.