Maheshwari, A., Sahu, D., & Verma, N. (2026). Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects?
Cita Chicago Style (17a ed.)Maheshwari, Animesh, Divyansh Sahu, y Nishit Verma. Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects? 2026.
Cita MLA (9a ed.)Maheshwari, Animesh, et al. Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects? 2026.
Precaución: Estas citas no son 100% exactas.