Kimi-VL Technical Report
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866918068139065344 |
|---|---|
| author | Kimi Team Du, Angang Yin, Bohong Xing, Bowei Qu, Bowen Wang, Bowen Chen, Cheng Zhang, Chenlin Du, Chenzhuang Wei, Chu Wang, Congcong Zhang, Dehao Du, Dikang Wang, Dongliang Yuan, Enming Lu, Enzhe Li, Fang Sung, Flood Wei, Guangda Lai, Guokun Zhu, Han Ding, Hao Hu, Hao Yang, Hao Zhang, Hao Wu, Haoning Yao, Haotian Lu, Haoyu Wang, Heng Gao, Hongcheng Zheng, Huabin Li, Jiaming Su, Jianlin Wang, Jianzhou Deng, Jiaqi Qiu, Jiezhong Xie, Jin Wang, Jinhong Liu, Jingyuan Yan, Junjie Ouyang, Kun Chen, Liang Sui, Lin Yu, Longhui Dong, Mengfan Dong, Mengnan Xu, Nuo Cheng, Pengyu Gu, Qizheng Zhou, Runjie Liu, Shaowei Cao, Sihan Yu, Tao Song, Tianhui Bai, Tongtong Song, Wei He, Weiran Huang, Weixiao Xu, Weixin Yuan, Xiaokun Yao, Xingcheng Wu, Xingzhe Li, Xinhao Zu, Xinxing Zhou, Xinyu Wang, Xinyuan Charles, Y. Zhong, Yan Li, Yang Hu, Yangyang Chen, Yanru Wang, Yejie Liu, Yibo Miao, Yibo Qin, Yidao Chen, Yimin Bao, Yiping Wang, Yiqin Kang, Yongsheng Liu, Yuanxin Dong, Yuhao Du, Yulun Wu, Yuxin Wang, Yuzhi Yan, Yuzi Zhou, Zaida Li, Zhaowei Jiang, Zhejun Zhang, Zheng Yang, Zhilin Huang, Zhiqi Huang, Zihao Zhao, Zijia Chen, Ziwei Lin, Zongyu |
| author_facet | Kimi Team Du, Angang Yin, Bohong Xing, Bowei Qu, Bowen Wang, Bowen Chen, Cheng Zhang, Chenlin Du, Chenzhuang Wei, Chu Wang, Congcong Zhang, Dehao Du, Dikang Wang, Dongliang Yuan, Enming Lu, Enzhe Li, Fang Sung, Flood Wei, Guangda Lai, Guokun Zhu, Han Ding, Hao Hu, Hao Yang, Hao Zhang, Hao Wu, Haoning Yao, Haotian Lu, Haoyu Wang, Heng Gao, Hongcheng Zheng, Huabin Li, Jiaming Su, Jianlin Wang, Jianzhou Deng, Jiaqi Qiu, Jiezhong Xie, Jin Wang, Jinhong Liu, Jingyuan Yan, Junjie Ouyang, Kun Chen, Liang Sui, Lin Yu, Longhui Dong, Mengfan Dong, Mengnan Xu, Nuo Cheng, Pengyu Gu, Qizheng Zhou, Runjie Liu, Shaowei Cao, Sihan Yu, Tao Song, Tianhui Bai, Tongtong Song, Wei He, Weiran Huang, Weixiao Xu, Weixin Yuan, Xiaokun Yao, Xingcheng Wu, Xingzhe Li, Xinhao Zu, Xinxing Zhou, Xinyu Wang, Xinyuan Charles, Y. Zhong, Yan Li, Yang Hu, Yangyang Chen, Yanru Wang, Yejie Liu, Yibo Miao, Yibo Qin, Yidao Chen, Yimin Bao, Yiping Wang, Yiqin Kang, Yongsheng Liu, Yuanxin Dong, Yuhao Du, Yulun Wu, Yuxin Wang, Yuzhi Yan, Yuzi Zhou, Zaida Li, Zhaowei Jiang, Zhejun Zhang, Zheng Yang, Zhilin Huang, Zhiqi Huang, Zihao Zhao, Zijia Chen, Ziwei Lin, Zongyu |
| contents | We present Kimi-VL, an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities - all while activating only 2.8B parameters in its language decoder (Kimi-VL-A3B). Kimi-VL demonstrates strong performance across challenging domains: as a general-purpose VLM, Kimi-VL excels in multi-turn agent tasks (e.g., OSWorld), matching flagship models. Furthermore, it exhibits remarkable capabilities across diverse challenging vision language tasks, including college-level image and video comprehension, OCR, mathematical reasoning, and multi-image understanding. In comparative evaluations, it effectively competes with cutting-edge efficient VLMs such as GPT-4o-mini, Qwen2.5-VL-7B, and Gemma-3-12B-IT, while surpassing GPT-4o in several key domains. Kimi-VL also advances in processing long contexts and perceiving clearly. With a 128K extended context window, Kimi-VL can process diverse long inputs, achieving impressive scores of 64.5 on LongVideoBench and 35.1 on MMLongBench-Doc. Its native-resolution vision encoder, MoonViT, further allows it to see and understand ultra-high-resolution visual inputs, achieving 83.2 on InfoVQA and 34.5 on ScreenSpot-Pro, while maintaining lower computational cost for common tasks. Building upon Kimi-VL, we introduce an advanced long-thinking variant: Kimi-VL-Thinking-2506. Developed through long chain-of-thought (CoT) supervised fine-tuning (SFT) and reinforcement learning (RL), the latest model exhibits strong long-horizon reasoning capabilities (64.0 on MMMU, 46.3 on MMMU-Pro, 56.9 on MathVision, 80.1 on MathVista, 65.2 on VideoMMMU) while obtaining robust general abilities. Code and models are publicly accessible at https://github.com/MoonshotAI/Kimi-VL. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2504_07491 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | Kimi-VL Technical Report Kimi Team Du, Angang Yin, Bohong Xing, Bowei Qu, Bowen Wang, Bowen Chen, Cheng Zhang, Chenlin Du, Chenzhuang Wei, Chu Wang, Congcong Zhang, Dehao Du, Dikang Wang, Dongliang Yuan, Enming Lu, Enzhe Li, Fang Sung, Flood Wei, Guangda Lai, Guokun Zhu, Han Ding, Hao Hu, Hao Yang, Hao Zhang, Hao Wu, Haoning Yao, Haotian Lu, Haoyu Wang, Heng Gao, Hongcheng Zheng, Huabin Li, Jiaming Su, Jianlin Wang, Jianzhou Deng, Jiaqi Qiu, Jiezhong Xie, Jin Wang, Jinhong Liu, Jingyuan Yan, Junjie Ouyang, Kun Chen, Liang Sui, Lin Yu, Longhui Dong, Mengfan Dong, Mengnan Xu, Nuo Cheng, Pengyu Gu, Qizheng Zhou, Runjie Liu, Shaowei Cao, Sihan Yu, Tao Song, Tianhui Bai, Tongtong Song, Wei He, Weiran Huang, Weixiao Xu, Weixin Yuan, Xiaokun Yao, Xingcheng Wu, Xingzhe Li, Xinhao Zu, Xinxing Zhou, Xinyu Wang, Xinyuan Charles, Y. Zhong, Yan Li, Yang Hu, Yangyang Chen, Yanru Wang, Yejie Liu, Yibo Miao, Yibo Qin, Yidao Chen, Yimin Bao, Yiping Wang, Yiqin Kang, Yongsheng Liu, Yuanxin Dong, Yuhao Du, Yulun Wu, Yuxin Wang, Yuzhi Yan, Yuzi Zhou, Zaida Li, Zhaowei Jiang, Zhejun Zhang, Zheng Yang, Zhilin Huang, Zhiqi Huang, Zihao Zhao, Zijia Chen, Ziwei Lin, Zongyu Computer Vision and Pattern Recognition We present Kimi-VL, an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities - all while activating only 2.8B parameters in its language decoder (Kimi-VL-A3B). Kimi-VL demonstrates strong performance across challenging domains: as a general-purpose VLM, Kimi-VL excels in multi-turn agent tasks (e.g., OSWorld), matching flagship models. Furthermore, it exhibits remarkable capabilities across diverse challenging vision language tasks, including college-level image and video comprehension, OCR, mathematical reasoning, and multi-image understanding. In comparative evaluations, it effectively competes with cutting-edge efficient VLMs such as GPT-4o-mini, Qwen2.5-VL-7B, and Gemma-3-12B-IT, while surpassing GPT-4o in several key domains. Kimi-VL also advances in processing long contexts and perceiving clearly. With a 128K extended context window, Kimi-VL can process diverse long inputs, achieving impressive scores of 64.5 on LongVideoBench and 35.1 on MMLongBench-Doc. Its native-resolution vision encoder, MoonViT, further allows it to see and understand ultra-high-resolution visual inputs, achieving 83.2 on InfoVQA and 34.5 on ScreenSpot-Pro, while maintaining lower computational cost for common tasks. Building upon Kimi-VL, we introduce an advanced long-thinking variant: Kimi-VL-Thinking-2506. Developed through long chain-of-thought (CoT) supervised fine-tuning (SFT) and reinforcement learning (RL), the latest model exhibits strong long-horizon reasoning capabilities (64.0 on MMMU, 46.3 on MMMU-Pro, 56.9 on MathVision, 80.1 on MathVista, 65.2 on VideoMMMU) while obtaining robust general abilities. Code and models are publicly accessible at https://github.com/MoonshotAI/Kimi-VL. |
| title | Kimi-VL Technical Report |
| topic | Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2504.07491 |