Lumina-Image 2.0: A Unified and Efficient Image Generative Framework

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Qin, Qi, Zhuo, Le, Xin, Yi, Du, Ruoyi, Li, Zhen, Fu, Bin, Lu, Yiting, Yuan, Jiakang, Li, Xinyue, Liu, Dongyang, Zhu, Xiangyang, Zhang, Manyuan, Beddow, Will, Millon, Erwann, Perez, Victor, Wang, Wenhai, He, Conghui, Zhang, Bo, Liu, Xiaohong, Li, Hongsheng, Qiao, Yu, Xu, Chang, Gao, Peng
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866916664118870016
author Qin, Qi
Zhuo, Le
Xin, Yi
Du, Ruoyi
Li, Zhen
Fu, Bin
Lu, Yiting
Yuan, Jiakang
Li, Xinyue
Liu, Dongyang
Zhu, Xiangyang
Zhang, Manyuan
Beddow, Will
Millon, Erwann
Perez, Victor
Wang, Wenhai
He, Conghui
Zhang, Bo
Liu, Xiaohong
Li, Hongsheng
Qiao, Yu
Xu, Chang
Gao, Peng
author_facet Qin, Qi
Zhuo, Le
Xin, Yi
Du, Ruoyi
Li, Zhen
Fu, Bin
Lu, Yiting
Yuan, Jiakang
Li, Xinyue
Liu, Dongyang
Zhu, Xiangyang
Zhang, Manyuan
Beddow, Will
Millon, Erwann
Perez, Victor
Wang, Wenhai
He, Conghui
Zhang, Bo
Liu, Xiaohong
Li, Hongsheng
Qiao, Yu
Xu, Chang
Gao, Peng
contents We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically designed for T2I generation tasks. UniCap excels at generating comprehensive and accurate captions, accelerating convergence and enhancing prompt adherence. (2) Efficiency - to improve the efficiency of our proposed model, we develop multi-stage progressive training strategies and introduce inference acceleration techniques without compromising image quality. Extensive evaluations on academic benchmarks and public text-to-image arenas show that Lumina-Image 2.0 delivers strong performances even with only 2.6B parameters, highlighting its scalability and design efficiency. We have released our training details, code, and models at https://github.com/Alpha-VLLM/Lumina-Image-2.0.
format Preprint
id arxiv_https___arxiv_org_abs_2503_21758
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
Qin, Qi
Zhuo, Le
Xin, Yi
Du, Ruoyi
Li, Zhen
Fu, Bin
Lu, Yiting
Yuan, Jiakang
Li, Xinyue
Liu, Dongyang
Zhu, Xiangyang
Zhang, Manyuan
Beddow, Will
Millon, Erwann
Perez, Victor
Wang, Wenhai
He, Conghui
Zhang, Bo
Liu, Xiaohong
Li, Hongsheng
Qiao, Yu
Xu, Chang
Gao, Peng
Computer Vision and Pattern Recognition
We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically designed for T2I generation tasks. UniCap excels at generating comprehensive and accurate captions, accelerating convergence and enhancing prompt adherence. (2) Efficiency - to improve the efficiency of our proposed model, we develop multi-stage progressive training strategies and introduce inference acceleration techniques without compromising image quality. Extensive evaluations on academic benchmarks and public text-to-image arenas show that Lumina-Image 2.0 delivers strong performances even with only 2.6B parameters, highlighting its scalability and design efficiency. We have released our training details, code, and models at https://github.com/Alpha-VLLM/Lumina-Image-2.0.
title Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2503.21758