Ming-Omni: A Unified Multimodal Model for Perception and Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
| _version_ | 1866912424641167360 |
|---|---|
| author | AI, Inclusion Gong, Biao Zou, Cheng Zheng, Chuanyang Zhou, Chunluan Yan, Canxiang Jin, Chunxiang Shen, Chunjie Zheng, Dandan Wang, Fudong Xu, Furong Yao, GuangMing Zhou, Jun Chen, Jingdong Sun, Jianxin Liu, Jiajia Zhu, Jianjiang Peng, Jun Ji, Kaixiang Song, Kaiyou Ren, Kaimeng Wang, Libin Ru, Lixiang Xie, Lele Tan, Longhua Xue, Lyuxin Wang, Lan Bai, Mochen Gao, Ning Chen, Pei Guo, Qingpei Zhang, Qinglong Xu, Qiang Liu, Rui Xiong, Ruijie Gao, Sirui Liu, Tinghao Li, Taisong Chai, Weilong Xiao, Xinyu Wang, Xiaomei Chen, Xiaoxue Lu, Xiao Li, Xiaoyu Dong, Xingning Yu, Xuzheng Yuan, Yi Gao, Yuting Sun, Yunxiao Chen, Yipeng Wu, Yifei Lyu, Yongjie Ma, Ziping Feng, Zipeng Fang, Zhijiang Qiu, Zhihao Huang, Ziyuan He, Zhengyu |
| author_facet | AI, Inclusion Gong, Biao Zou, Cheng Zheng, Chuanyang Zhou, Chunluan Yan, Canxiang Jin, Chunxiang Shen, Chunjie Zheng, Dandan Wang, Fudong Xu, Furong Yao, GuangMing Zhou, Jun Chen, Jingdong Sun, Jianxin Liu, Jiajia Zhu, Jianjiang Peng, Jun Ji, Kaixiang Song, Kaiyou Ren, Kaimeng Wang, Libin Ru, Lixiang Xie, Lele Tan, Longhua Xue, Lyuxin Wang, Lan Bai, Mochen Gao, Ning Chen, Pei Guo, Qingpei Zhang, Qinglong Xu, Qiang Liu, Rui Xiong, Ruijie Gao, Sirui Liu, Tinghao Li, Taisong Chai, Weilong Xiao, Xinyu Wang, Xiaomei Chen, Xiaoxue Lu, Xiao Li, Xiaoyu Dong, Xingning Yu, Xuzheng Yuan, Yi Gao, Yuting Sun, Yunxiao Chen, Yipeng Wu, Yifei Lyu, Yongjie Ma, Ziping Feng, Zipeng Fang, Zhijiang Qiu, Zhihao Huang, Ziyuan He, Zhengyu |
| contents | We propose Ming-Omni, a unified multimodal model capable of processing images, text, audio, and video, while demonstrating strong proficiency in both speech and image generation. Ming-Omni employs dedicated encoders to extract tokens from different modalities, which are then processed by Ling, an MoE architecture equipped with newly proposed modality-specific routers. This design enables a single model to efficiently process and fuse multimodal inputs within a unified framework, thereby facilitating diverse tasks without requiring separate models, task-specific fine-tuning, or structural redesign. Importantly, Ming-Omni extends beyond conventional multimodal models by supporting audio and image generation. This is achieved through the integration of an advanced audio decoder for natural-sounding speech and Ming-Lite-Uni for high-quality image generation, which also allow the model to engage in context-aware chatting, perform text-to-speech conversion, and conduct versatile image editing. Our experimental results showcase Ming-Omni offers a powerful solution for unified perception and generation across all modalities. Notably, our proposed Ming-Omni is the first open-source model we are aware of to match GPT-4o in modality support, and we release all code and model weights to encourage further research and development in the community. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2506_09344 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | Ming-Omni: A Unified Multimodal Model for Perception and Generation AI, Inclusion Gong, Biao Zou, Cheng Zheng, Chuanyang Zhou, Chunluan Yan, Canxiang Jin, Chunxiang Shen, Chunjie Zheng, Dandan Wang, Fudong Xu, Furong Yao, GuangMing Zhou, Jun Chen, Jingdong Sun, Jianxin Liu, Jiajia Zhu, Jianjiang Peng, Jun Ji, Kaixiang Song, Kaiyou Ren, Kaimeng Wang, Libin Ru, Lixiang Xie, Lele Tan, Longhua Xue, Lyuxin Wang, Lan Bai, Mochen Gao, Ning Chen, Pei Guo, Qingpei Zhang, Qinglong Xu, Qiang Liu, Rui Xiong, Ruijie Gao, Sirui Liu, Tinghao Li, Taisong Chai, Weilong Xiao, Xinyu Wang, Xiaomei Chen, Xiaoxue Lu, Xiao Li, Xiaoyu Dong, Xingning Yu, Xuzheng Yuan, Yi Gao, Yuting Sun, Yunxiao Chen, Yipeng Wu, Yifei Lyu, Yongjie Ma, Ziping Feng, Zipeng Fang, Zhijiang Qiu, Zhihao Huang, Ziyuan He, Zhengyu Artificial Intelligence Computation and Language Computer Vision and Pattern Recognition Machine Learning Sound Audio and Speech Processing We propose Ming-Omni, a unified multimodal model capable of processing images, text, audio, and video, while demonstrating strong proficiency in both speech and image generation. Ming-Omni employs dedicated encoders to extract tokens from different modalities, which are then processed by Ling, an MoE architecture equipped with newly proposed modality-specific routers. This design enables a single model to efficiently process and fuse multimodal inputs within a unified framework, thereby facilitating diverse tasks without requiring separate models, task-specific fine-tuning, or structural redesign. Importantly, Ming-Omni extends beyond conventional multimodal models by supporting audio and image generation. This is achieved through the integration of an advanced audio decoder for natural-sounding speech and Ming-Lite-Uni for high-quality image generation, which also allow the model to engage in context-aware chatting, perform text-to-speech conversion, and conduct versatile image editing. Our experimental results showcase Ming-Omni offers a powerful solution for unified perception and generation across all modalities. Notably, our proposed Ming-Omni is the first open-source model we are aware of to match GPT-4o in modality support, and we release all code and model weights to encourage further research and development in the community. |
| title | Ming-Omni: A Unified Multimodal Model for Perception and Generation |
| topic | Artificial Intelligence Computation and Language Computer Vision and Pattern Recognition Machine Learning Sound Audio and Speech Processing |
| url | https://arxiv.org/abs/2506.09344 |