Wang, X., Zhang, K., Jia, Q., Chen, Z., Zhai, G., & Min, X. (2026). KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?
Chicago Style (17th ed.) CitationWang, Xianfeng, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, and Xiongkuo Min. KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old? 2026.
MLA (9th ed.) CitationWang, Xianfeng, et al. KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old? 2026.
Warning: These citations may not always be 100% accurate.