_version_ 1866912424641167360
author AI, Inclusion
Gong, Biao
Zou, Cheng
Zheng, Chuanyang
Zhou, Chunluan
Yan, Canxiang
Jin, Chunxiang
Shen, Chunjie
Zheng, Dandan
Wang, Fudong
Xu, Furong
Yao, GuangMing
Zhou, Jun
Chen, Jingdong
Sun, Jianxin
Liu, Jiajia
Zhu, Jianjiang
Peng, Jun
Ji, Kaixiang
Song, Kaiyou
Ren, Kaimeng
Wang, Libin
Ru, Lixiang
Xie, Lele
Tan, Longhua
Xue, Lyuxin
Wang, Lan
Bai, Mochen
Gao, Ning
Chen, Pei
Guo, Qingpei
Zhang, Qinglong
Xu, Qiang
Liu, Rui
Xiong, Ruijie
Gao, Sirui
Liu, Tinghao
Li, Taisong
Chai, Weilong
Xiao, Xinyu
Wang, Xiaomei
Chen, Xiaoxue
Lu, Xiao
Li, Xiaoyu
Dong, Xingning
Yu, Xuzheng
Yuan, Yi
Gao, Yuting
Sun, Yunxiao
Chen, Yipeng
Wu, Yifei
Lyu, Yongjie
Ma, Ziping
Feng, Zipeng
Fang, Zhijiang
Qiu, Zhihao
Huang, Ziyuan
He, Zhengyu
author_facet AI, Inclusion
Gong, Biao
Zou, Cheng
Zheng, Chuanyang
Zhou, Chunluan
Yan, Canxiang
Jin, Chunxiang
Shen, Chunjie
Zheng, Dandan
Wang, Fudong
Xu, Furong
Yao, GuangMing
Zhou, Jun
Chen, Jingdong
Sun, Jianxin
Liu, Jiajia
Zhu, Jianjiang
Peng, Jun
Ji, Kaixiang
Song, Kaiyou
Ren, Kaimeng
Wang, Libin
Ru, Lixiang
Xie, Lele
Tan, Longhua
Xue, Lyuxin
Wang, Lan
Bai, Mochen
Gao, Ning
Chen, Pei
Guo, Qingpei
Zhang, Qinglong
Xu, Qiang
Liu, Rui
Xiong, Ruijie
Gao, Sirui
Liu, Tinghao
Li, Taisong
Chai, Weilong
Xiao, Xinyu
Wang, Xiaomei
Chen, Xiaoxue
Lu, Xiao
Li, Xiaoyu
Dong, Xingning
Yu, Xuzheng
Yuan, Yi
Gao, Yuting
Sun, Yunxiao
Chen, Yipeng
Wu, Yifei
Lyu, Yongjie
Ma, Ziping
Feng, Zipeng
Fang, Zhijiang
Qiu, Zhihao
Huang, Ziyuan
He, Zhengyu
contents We propose Ming-Omni, a unified multimodal model capable of processing images, text, audio, and video, while demonstrating strong proficiency in both speech and image generation. Ming-Omni employs dedicated encoders to extract tokens from different modalities, which are then processed by Ling, an MoE architecture equipped with newly proposed modality-specific routers. This design enables a single model to efficiently process and fuse multimodal inputs within a unified framework, thereby facilitating diverse tasks without requiring separate models, task-specific fine-tuning, or structural redesign. Importantly, Ming-Omni extends beyond conventional multimodal models by supporting audio and image generation. This is achieved through the integration of an advanced audio decoder for natural-sounding speech and Ming-Lite-Uni for high-quality image generation, which also allow the model to engage in context-aware chatting, perform text-to-speech conversion, and conduct versatile image editing. Our experimental results showcase Ming-Omni offers a powerful solution for unified perception and generation across all modalities. Notably, our proposed Ming-Omni is the first open-source model we are aware of to match GPT-4o in modality support, and we release all code and model weights to encourage further research and development in the community.
format Preprint
id arxiv_https___arxiv_org_abs_2506_09344
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Ming-Omni: A Unified Multimodal Model for Perception and Generation
AI, Inclusion
Gong, Biao
Zou, Cheng
Zheng, Chuanyang
Zhou, Chunluan
Yan, Canxiang
Jin, Chunxiang
Shen, Chunjie
Zheng, Dandan
Wang, Fudong
Xu, Furong
Yao, GuangMing
Zhou, Jun
Chen, Jingdong
Sun, Jianxin
Liu, Jiajia
Zhu, Jianjiang
Peng, Jun
Ji, Kaixiang
Song, Kaiyou
Ren, Kaimeng
Wang, Libin
Ru, Lixiang
Xie, Lele
Tan, Longhua
Xue, Lyuxin
Wang, Lan
Bai, Mochen
Gao, Ning
Chen, Pei
Guo, Qingpei
Zhang, Qinglong
Xu, Qiang
Liu, Rui
Xiong, Ruijie
Gao, Sirui
Liu, Tinghao
Li, Taisong
Chai, Weilong
Xiao, Xinyu
Wang, Xiaomei
Chen, Xiaoxue
Lu, Xiao
Li, Xiaoyu
Dong, Xingning
Yu, Xuzheng
Yuan, Yi
Gao, Yuting
Sun, Yunxiao
Chen, Yipeng
Wu, Yifei
Lyu, Yongjie
Ma, Ziping
Feng, Zipeng
Fang, Zhijiang
Qiu, Zhihao
Huang, Ziyuan
He, Zhengyu
Artificial Intelligence
Computation and Language
Computer Vision and Pattern Recognition
Machine Learning
Sound
Audio and Speech Processing
We propose Ming-Omni, a unified multimodal model capable of processing images, text, audio, and video, while demonstrating strong proficiency in both speech and image generation. Ming-Omni employs dedicated encoders to extract tokens from different modalities, which are then processed by Ling, an MoE architecture equipped with newly proposed modality-specific routers. This design enables a single model to efficiently process and fuse multimodal inputs within a unified framework, thereby facilitating diverse tasks without requiring separate models, task-specific fine-tuning, or structural redesign. Importantly, Ming-Omni extends beyond conventional multimodal models by supporting audio and image generation. This is achieved through the integration of an advanced audio decoder for natural-sounding speech and Ming-Lite-Uni for high-quality image generation, which also allow the model to engage in context-aware chatting, perform text-to-speech conversion, and conduct versatile image editing. Our experimental results showcase Ming-Omni offers a powerful solution for unified perception and generation across all modalities. Notably, our proposed Ming-Omni is the first open-source model we are aware of to match GPT-4o in modality support, and we release all code and model weights to encourage further research and development in the community.
title Ming-Omni: A Unified Multimodal Model for Perception and Generation
topic Artificial Intelligence
Computation and Language
Computer Vision and Pattern Recognition
Machine Learning
Sound
Audio and Speech Processing
url https://arxiv.org/abs/2506.09344