Song, Z., Li, Q., Zhou, J., Yuan, Z., Chen, T., Lin, L., & Wang, G. (2026). Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models.
Chicago Style (17th ed.) CitationSong, Zijian, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, and Guangrun Wang. Robotic Manipulation Is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models. 2026.
MLA (9th ed.) CitationSong, Zijian, et al. Robotic Manipulation Is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models. 2026.
Warning: These citations may not always be 100% accurate.