MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Li, Yanghao, Qian, Rui, Pan, Bowen, Zhang, Haotian, Huang, Haoshuo, Zhang, Bowen, Tong, Jialing, You, Haoxuan, Du, Xianzhi, Gan, Zhe, Kim, Hyunjik, Jia, Chao, Wang, Zhenbang, Yang, Yinfei, Gao, Mingfei, Dou, Zi-Yi, Hu, Wenze, Gao, Chang, Li, Dongxu, Dufter, Philipp, Wang, Zirui, Yin, Guoli, Zhang, Zhengdong, Chen, Chen, Zhao, Yang, Pang, Ruoming, Chen, Zhifeng
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!