Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
Fuente:
arXiv
Guardado en:
| Autores principales: | , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
| _version_ | 1866916664118870016 |
|---|---|
| author | Qin, Qi Zhuo, Le Xin, Yi Du, Ruoyi Li, Zhen Fu, Bin Lu, Yiting Yuan, Jiakang Li, Xinyue Liu, Dongyang Zhu, Xiangyang Zhang, Manyuan Beddow, Will Millon, Erwann Perez, Victor Wang, Wenhai He, Conghui Zhang, Bo Liu, Xiaohong Li, Hongsheng Qiao, Yu Xu, Chang Gao, Peng |
| author_facet | Qin, Qi Zhuo, Le Xin, Yi Du, Ruoyi Li, Zhen Fu, Bin Lu, Yiting Yuan, Jiakang Li, Xinyue Liu, Dongyang Zhu, Xiangyang Zhang, Manyuan Beddow, Will Millon, Erwann Perez, Victor Wang, Wenhai He, Conghui Zhang, Bo Liu, Xiaohong Li, Hongsheng Qiao, Yu Xu, Chang Gao, Peng |
| contents | We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically designed for T2I generation tasks. UniCap excels at generating comprehensive and accurate captions, accelerating convergence and enhancing prompt adherence. (2) Efficiency - to improve the efficiency of our proposed model, we develop multi-stage progressive training strategies and introduce inference acceleration techniques without compromising image quality. Extensive evaluations on academic benchmarks and public text-to-image arenas show that Lumina-Image 2.0 delivers strong performances even with only 2.6B parameters, highlighting its scalability and design efficiency. We have released our training details, code, and models at https://github.com/Alpha-VLLM/Lumina-Image-2.0. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2503_21758 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | Lumina-Image 2.0: A Unified and Efficient Image Generative Framework Qin, Qi Zhuo, Le Xin, Yi Du, Ruoyi Li, Zhen Fu, Bin Lu, Yiting Yuan, Jiakang Li, Xinyue Liu, Dongyang Zhu, Xiangyang Zhang, Manyuan Beddow, Will Millon, Erwann Perez, Victor Wang, Wenhai He, Conghui Zhang, Bo Liu, Xiaohong Li, Hongsheng Qiao, Yu Xu, Chang Gao, Peng Computer Vision and Pattern Recognition We introduce Lumina-Image 2.0, an advanced text-to-image generation framework that achieves significant progress compared to previous work, Lumina-Next. Lumina-Image 2.0 is built upon two key principles: (1) Unification - it adopts a unified architecture (Unified Next-DiT) that treats text and image tokens as a joint sequence, enabling natural cross-modal interactions and allowing seamless task expansion. Besides, since high-quality captioners can provide semantically well-aligned text-image training pairs, we introduce a unified captioning system, Unified Captioner (UniCap), specifically designed for T2I generation tasks. UniCap excels at generating comprehensive and accurate captions, accelerating convergence and enhancing prompt adherence. (2) Efficiency - to improve the efficiency of our proposed model, we develop multi-stage progressive training strategies and introduce inference acceleration techniques without compromising image quality. Extensive evaluations on academic benchmarks and public text-to-image arenas show that Lumina-Image 2.0 delivers strong performances even with only 2.6B parameters, highlighting its scalability and design efficiency. We have released our training details, code, and models at https://github.com/Alpha-VLLM/Lumina-Image-2.0. |
| title | Lumina-Image 2.0: A Unified and Efficient Image Generative Framework |
| topic | Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2503.21758 |