Kimi-VL Technical Report

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Kimi Team, Du, Angang, Yin, Bohong, Xing, Bowei, Qu, Bowen, Wang, Bowen, Chen, Cheng, Zhang, Chenlin, Du, Chenzhuang, Wei, Chu, Wang, Congcong, Zhang, Dehao, Du, Dikang, Wang, Dongliang, Yuan, Enming, Lu, Enzhe, Li, Fang, Sung, Flood, Wei, Guangda, Lai, Guokun, Zhu, Han, Ding, Hao, Hu, Hao, Yang, Hao, Zhang, Hao, Wu, Haoning, Yao, Haotian, Lu, Haoyu, Wang, Heng, Gao, Hongcheng, Zheng, Huabin, Li, Jiaming, Su, Jianlin, Wang, Jianzhou, Deng, Jiaqi, Qiu, Jiezhong, Xie, Jin, Wang, Jinhong, Liu, Jingyuan, Yan, Junjie, Ouyang, Kun, Chen, Liang, Sui, Lin, Yu, Longhui, Dong, Mengfan, Dong, Mengnan, Xu, Nuo, Cheng, Pengyu, Gu, Qizheng, Zhou, Runjie, Liu, Shaowei, Cao, Sihan, Yu, Tao, Song, Tianhui, Bai, Tongtong, Song, Wei, He, Weiran, Huang, Weixiao, Xu, Weixin, Yuan, Xiaokun, Yao, Xingcheng, Wu, Xingzhe, Li, Xinhao, Zu, Xinxing, Zhou, Xinyu, Wang, Xinyuan, Charles, Y., Zhong, Yan, Li, Yang, Hu, Yangyang, Chen, Yanru, Wang, Yejie, Liu, Yibo, Miao, Yibo, Qin, Yidao, Chen, Yimin, Bao, Yiping, Wang, Yiqin, Kang, Yongsheng, Liu, Yuanxin, Dong, Yuhao, Du, Yulun, Wu, Yuxin, Wang, Yuzhi, Yan, Yuzi, Zhou, Zaida, Li, Zhaowei, Jiang, Zhejun, Zhang, Zheng, Yang, Zhilin, Huang, Zhiqi, Huang, Zihao, Zhao, Zijia, Chen, Ziwei, Lin, Zongyu
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918068139065344
author Kimi Team
Du, Angang
Yin, Bohong
Xing, Bowei
Qu, Bowen
Wang, Bowen
Chen, Cheng
Zhang, Chenlin
Du, Chenzhuang
Wei, Chu
Wang, Congcong
Zhang, Dehao
Du, Dikang
Wang, Dongliang
Yuan, Enming
Lu, Enzhe
Li, Fang
Sung, Flood
Wei, Guangda
Lai, Guokun
Zhu, Han
Ding, Hao
Hu, Hao
Yang, Hao
Zhang, Hao
Wu, Haoning
Yao, Haotian
Lu, Haoyu
Wang, Heng
Gao, Hongcheng
Zheng, Huabin
Li, Jiaming
Su, Jianlin
Wang, Jianzhou
Deng, Jiaqi
Qiu, Jiezhong
Xie, Jin
Wang, Jinhong
Liu, Jingyuan
Yan, Junjie
Ouyang, Kun
Chen, Liang
Sui, Lin
Yu, Longhui
Dong, Mengfan
Dong, Mengnan
Xu, Nuo
Cheng, Pengyu
Gu, Qizheng
Zhou, Runjie
Liu, Shaowei
Cao, Sihan
Yu, Tao
Song, Tianhui
Bai, Tongtong
Song, Wei
He, Weiran
Huang, Weixiao
Xu, Weixin
Yuan, Xiaokun
Yao, Xingcheng
Wu, Xingzhe
Li, Xinhao
Zu, Xinxing
Zhou, Xinyu
Wang, Xinyuan
Charles, Y.
Zhong, Yan
Li, Yang
Hu, Yangyang
Chen, Yanru
Wang, Yejie
Liu, Yibo
Miao, Yibo
Qin, Yidao
Chen, Yimin
Bao, Yiping
Wang, Yiqin
Kang, Yongsheng
Liu, Yuanxin
Dong, Yuhao
Du, Yulun
Wu, Yuxin
Wang, Yuzhi
Yan, Yuzi
Zhou, Zaida
Li, Zhaowei
Jiang, Zhejun
Zhang, Zheng
Yang, Zhilin
Huang, Zhiqi
Huang, Zihao
Zhao, Zijia
Chen, Ziwei
Lin, Zongyu
author_facet Kimi Team
Du, Angang
Yin, Bohong
Xing, Bowei
Qu, Bowen
Wang, Bowen
Chen, Cheng
Zhang, Chenlin
Du, Chenzhuang
Wei, Chu
Wang, Congcong
Zhang, Dehao
Du, Dikang
Wang, Dongliang
Yuan, Enming
Lu, Enzhe
Li, Fang
Sung, Flood
Wei, Guangda
Lai, Guokun
Zhu, Han
Ding, Hao
Hu, Hao
Yang, Hao
Zhang, Hao
Wu, Haoning
Yao, Haotian
Lu, Haoyu
Wang, Heng
Gao, Hongcheng
Zheng, Huabin
Li, Jiaming
Su, Jianlin
Wang, Jianzhou
Deng, Jiaqi
Qiu, Jiezhong
Xie, Jin
Wang, Jinhong
Liu, Jingyuan
Yan, Junjie
Ouyang, Kun
Chen, Liang
Sui, Lin
Yu, Longhui
Dong, Mengfan
Dong, Mengnan
Xu, Nuo
Cheng, Pengyu
Gu, Qizheng
Zhou, Runjie
Liu, Shaowei
Cao, Sihan
Yu, Tao
Song, Tianhui
Bai, Tongtong
Song, Wei
He, Weiran
Huang, Weixiao
Xu, Weixin
Yuan, Xiaokun
Yao, Xingcheng
Wu, Xingzhe
Li, Xinhao
Zu, Xinxing
Zhou, Xinyu
Wang, Xinyuan
Charles, Y.
Zhong, Yan
Li, Yang
Hu, Yangyang
Chen, Yanru
Wang, Yejie
Liu, Yibo
Miao, Yibo
Qin, Yidao
Chen, Yimin
Bao, Yiping
Wang, Yiqin
Kang, Yongsheng
Liu, Yuanxin
Dong, Yuhao
Du, Yulun
Wu, Yuxin
Wang, Yuzhi
Yan, Yuzi
Zhou, Zaida
Li, Zhaowei
Jiang, Zhejun
Zhang, Zheng
Yang, Zhilin
Huang, Zhiqi
Huang, Zihao
Zhao, Zijia
Chen, Ziwei
Lin, Zongyu
contents We present Kimi-VL, an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities - all while activating only 2.8B parameters in its language decoder (Kimi-VL-A3B). Kimi-VL demonstrates strong performance across challenging domains: as a general-purpose VLM, Kimi-VL excels in multi-turn agent tasks (e.g., OSWorld), matching flagship models. Furthermore, it exhibits remarkable capabilities across diverse challenging vision language tasks, including college-level image and video comprehension, OCR, mathematical reasoning, and multi-image understanding. In comparative evaluations, it effectively competes with cutting-edge efficient VLMs such as GPT-4o-mini, Qwen2.5-VL-7B, and Gemma-3-12B-IT, while surpassing GPT-4o in several key domains. Kimi-VL also advances in processing long contexts and perceiving clearly. With a 128K extended context window, Kimi-VL can process diverse long inputs, achieving impressive scores of 64.5 on LongVideoBench and 35.1 on MMLongBench-Doc. Its native-resolution vision encoder, MoonViT, further allows it to see and understand ultra-high-resolution visual inputs, achieving 83.2 on InfoVQA and 34.5 on ScreenSpot-Pro, while maintaining lower computational cost for common tasks. Building upon Kimi-VL, we introduce an advanced long-thinking variant: Kimi-VL-Thinking-2506. Developed through long chain-of-thought (CoT) supervised fine-tuning (SFT) and reinforcement learning (RL), the latest model exhibits strong long-horizon reasoning capabilities (64.0 on MMMU, 46.3 on MMMU-Pro, 56.9 on MathVision, 80.1 on MathVista, 65.2 on VideoMMMU) while obtaining robust general abilities. Code and models are publicly accessible at https://github.com/MoonshotAI/Kimi-VL.
format Preprint
id arxiv_https___arxiv_org_abs_2504_07491
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Kimi-VL Technical Report
Kimi Team
Du, Angang
Yin, Bohong
Xing, Bowei
Qu, Bowen
Wang, Bowen
Chen, Cheng
Zhang, Chenlin
Du, Chenzhuang
Wei, Chu
Wang, Congcong
Zhang, Dehao
Du, Dikang
Wang, Dongliang
Yuan, Enming
Lu, Enzhe
Li, Fang
Sung, Flood
Wei, Guangda
Lai, Guokun
Zhu, Han
Ding, Hao
Hu, Hao
Yang, Hao
Zhang, Hao
Wu, Haoning
Yao, Haotian
Lu, Haoyu
Wang, Heng
Gao, Hongcheng
Zheng, Huabin
Li, Jiaming
Su, Jianlin
Wang, Jianzhou
Deng, Jiaqi
Qiu, Jiezhong
Xie, Jin
Wang, Jinhong
Liu, Jingyuan
Yan, Junjie
Ouyang, Kun
Chen, Liang
Sui, Lin
Yu, Longhui
Dong, Mengfan
Dong, Mengnan
Xu, Nuo
Cheng, Pengyu
Gu, Qizheng
Zhou, Runjie
Liu, Shaowei
Cao, Sihan
Yu, Tao
Song, Tianhui
Bai, Tongtong
Song, Wei
He, Weiran
Huang, Weixiao
Xu, Weixin
Yuan, Xiaokun
Yao, Xingcheng
Wu, Xingzhe
Li, Xinhao
Zu, Xinxing
Zhou, Xinyu
Wang, Xinyuan
Charles, Y.
Zhong, Yan
Li, Yang
Hu, Yangyang
Chen, Yanru
Wang, Yejie
Liu, Yibo
Miao, Yibo
Qin, Yidao
Chen, Yimin
Bao, Yiping
Wang, Yiqin
Kang, Yongsheng
Liu, Yuanxin
Dong, Yuhao
Du, Yulun
Wu, Yuxin
Wang, Yuzhi
Yan, Yuzi
Zhou, Zaida
Li, Zhaowei
Jiang, Zhejun
Zhang, Zheng
Yang, Zhilin
Huang, Zhiqi
Huang, Zihao
Zhao, Zijia
Chen, Ziwei
Lin, Zongyu
Computer Vision and Pattern Recognition
We present Kimi-VL, an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities - all while activating only 2.8B parameters in its language decoder (Kimi-VL-A3B). Kimi-VL demonstrates strong performance across challenging domains: as a general-purpose VLM, Kimi-VL excels in multi-turn agent tasks (e.g., OSWorld), matching flagship models. Furthermore, it exhibits remarkable capabilities across diverse challenging vision language tasks, including college-level image and video comprehension, OCR, mathematical reasoning, and multi-image understanding. In comparative evaluations, it effectively competes with cutting-edge efficient VLMs such as GPT-4o-mini, Qwen2.5-VL-7B, and Gemma-3-12B-IT, while surpassing GPT-4o in several key domains. Kimi-VL also advances in processing long contexts and perceiving clearly. With a 128K extended context window, Kimi-VL can process diverse long inputs, achieving impressive scores of 64.5 on LongVideoBench and 35.1 on MMLongBench-Doc. Its native-resolution vision encoder, MoonViT, further allows it to see and understand ultra-high-resolution visual inputs, achieving 83.2 on InfoVQA and 34.5 on ScreenSpot-Pro, while maintaining lower computational cost for common tasks. Building upon Kimi-VL, we introduce an advanced long-thinking variant: Kimi-VL-Thinking-2506. Developed through long chain-of-thought (CoT) supervised fine-tuning (SFT) and reinforcement learning (RL), the latest model exhibits strong long-horizon reasoning capabilities (64.0 on MMMU, 46.3 on MMMU-Pro, 56.9 on MathVision, 80.1 on MathVista, 65.2 on VideoMMMU) while obtaining robust general abilities. Code and models are publicly accessible at https://github.com/MoonshotAI/Kimi-VL.
title Kimi-VL Technical Report
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2504.07491