_version_ 1866918217202532352
author Wu, Bing
Zou, Chang
Li, Changlin
Huang, Duojun
Yang, Fang
Tan, Hao
Peng, Jack
Wu, Jianbing
Xiong, Jiangfeng
Jiang, Jie
Linus
Patrol
Zhang, Peizhen
Chen, Peng
Zhao, Penghao
Tian, Qi
Liu, Songtao
Kong, Weijie
Wang, Weiyan
He, Xiao
Li, Xin
Deng, Xinchi
Zhe, Xuefei
Li, Yang
Long, Yanxin
Peng, Yuanbo
Wu, Yue
Liu, Yuhong
Wang, Zhenyu
Dai, Zuozhuo
Peng, Bo
Li, Coopers
Gong, Gu
Xiao, Guojian
Tian, Jiahe
Lin, Jiaxin
Liu, Jie
Zhang, Jihong
Lian, Jiesong
Pan, Kaihang
Wang, Lei
Niu, Lin
Chen, Mingtao
Chen, Mingyang
Zheng, Mingzhe
Yang, Miles
Hu, Qiangqiang
Yang, Qi
Xiao, Qiuyong
Wu, Runzhou
Xu, Ryan
Yuan, Rui
Sang, Shanshan
Huang, Shisheng
Gong, Siruis
Huang, Shuo
Guo, Weiting
Yuan, Xiang
Chen, Xiaojia
Hu, Xiawei
Sun, Wenzhi
Wu, Xiele
Ren, Xianshun
Yuan, Xiaoyan
Mi, Xiaoyue
Zhang, Yepeng
Sun, Yifu
Lu, Yiting
Li, Yitong
Huang, You
Tang, Yu
Li, Yixuan
Deng, Yuhang
Zhou, Yuan
Hu, Zhichao
Liu, Zhiguang
Yang, Zhihe
Yang, Zilin
Lu, Zhenzhi
Zhou, Zixiang
Zhong, Zhao
author_facet Wu, Bing
Zou, Chang
Li, Changlin
Huang, Duojun
Yang, Fang
Tan, Hao
Peng, Jack
Wu, Jianbing
Xiong, Jiangfeng
Jiang, Jie
Linus
Patrol
Zhang, Peizhen
Chen, Peng
Zhao, Penghao
Tian, Qi
Liu, Songtao
Kong, Weijie
Wang, Weiyan
He, Xiao
Li, Xin
Deng, Xinchi
Zhe, Xuefei
Li, Yang
Long, Yanxin
Peng, Yuanbo
Wu, Yue
Liu, Yuhong
Wang, Zhenyu
Dai, Zuozhuo
Peng, Bo
Li, Coopers
Gong, Gu
Xiao, Guojian
Tian, Jiahe
Lin, Jiaxin
Liu, Jie
Zhang, Jihong
Lian, Jiesong
Pan, Kaihang
Wang, Lei
Niu, Lin
Chen, Mingtao
Chen, Mingyang
Zheng, Mingzhe
Yang, Miles
Hu, Qiangqiang
Yang, Qi
Xiao, Qiuyong
Wu, Runzhou
Xu, Ryan
Yuan, Rui
Sang, Shanshan
Huang, Shisheng
Gong, Siruis
Huang, Shuo
Guo, Weiting
Yuan, Xiang
Chen, Xiaojia
Hu, Xiawei
Sun, Wenzhi
Wu, Xiele
Ren, Xianshun
Yuan, Xiaoyan
Mi, Xiaoyue
Zhang, Yepeng
Sun, Yifu
Lu, Yiting
Li, Yitong
Huang, You
Tang, Yu
Li, Yixuan
Deng, Yuhang
Zhou, Yuan
Hu, Zhichao
Liu, Zhiguang
Yang, Zhihe
Yang, Zilin
Lu, Zhenzhi
Zhou, Zixiang
Zhong, Zhao
contents We present HunyuanVideo 1.5, a lightweight yet powerful open-source video generation model that achieves state-of-the-art visual quality and motion coherence with only 8.3 billion parameters, enabling efficient inference on consumer-grade GPUs. This achievement is built upon several key components, including meticulous data curation, an advanced DiT architecture featuring selective and sliding tile attention (SSTA), enhanced bilingual understanding through glyph-aware text encoding, progressive pre-training and post-training, and an efficient video super-resolution network. Leveraging these designs, we developed a unified framework capable of high-quality text-to-video and image-to-video generation across multiple durations and resolutions. Extensive experiments demonstrate that this compact and proficient model establishes a new state-of-the-art among open-source video generation models. By releasing the code and model weights, we provide the community with a high-performance foundation that lowers the barrier to video creation and research, making advanced video generation accessible to a broader audience. All open-source assets are publicly available at https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5.
format Preprint
id arxiv_https___arxiv_org_abs_2511_18870
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle HunyuanVideo 1.5 Technical Report
Wu, Bing
Zou, Chang
Li, Changlin
Huang, Duojun
Yang, Fang
Tan, Hao
Peng, Jack
Wu, Jianbing
Xiong, Jiangfeng
Jiang, Jie
Linus
Patrol
Zhang, Peizhen
Chen, Peng
Zhao, Penghao
Tian, Qi
Liu, Songtao
Kong, Weijie
Wang, Weiyan
He, Xiao
Li, Xin
Deng, Xinchi
Zhe, Xuefei
Li, Yang
Long, Yanxin
Peng, Yuanbo
Wu, Yue
Liu, Yuhong
Wang, Zhenyu
Dai, Zuozhuo
Peng, Bo
Li, Coopers
Gong, Gu
Xiao, Guojian
Tian, Jiahe
Lin, Jiaxin
Liu, Jie
Zhang, Jihong
Lian, Jiesong
Pan, Kaihang
Wang, Lei
Niu, Lin
Chen, Mingtao
Chen, Mingyang
Zheng, Mingzhe
Yang, Miles
Hu, Qiangqiang
Yang, Qi
Xiao, Qiuyong
Wu, Runzhou
Xu, Ryan
Yuan, Rui
Sang, Shanshan
Huang, Shisheng
Gong, Siruis
Huang, Shuo
Guo, Weiting
Yuan, Xiang
Chen, Xiaojia
Hu, Xiawei
Sun, Wenzhi
Wu, Xiele
Ren, Xianshun
Yuan, Xiaoyan
Mi, Xiaoyue
Zhang, Yepeng
Sun, Yifu
Lu, Yiting
Li, Yitong
Huang, You
Tang, Yu
Li, Yixuan
Deng, Yuhang
Zhou, Yuan
Hu, Zhichao
Liu, Zhiguang
Yang, Zhihe
Yang, Zilin
Lu, Zhenzhi
Zhou, Zixiang
Zhong, Zhao
Computer Vision and Pattern Recognition
We present HunyuanVideo 1.5, a lightweight yet powerful open-source video generation model that achieves state-of-the-art visual quality and motion coherence with only 8.3 billion parameters, enabling efficient inference on consumer-grade GPUs. This achievement is built upon several key components, including meticulous data curation, an advanced DiT architecture featuring selective and sliding tile attention (SSTA), enhanced bilingual understanding through glyph-aware text encoding, progressive pre-training and post-training, and an efficient video super-resolution network. Leveraging these designs, we developed a unified framework capable of high-quality text-to-video and image-to-video generation across multiple durations and resolutions. Extensive experiments demonstrate that this compact and proficient model establishes a new state-of-the-art among open-source video generation models. By releasing the code and model weights, we provide the community with a high-performance foundation that lowers the barrier to video creation and research, making advanced video generation accessible to a broader audience. All open-source assets are publicly available at https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5.
title HunyuanVideo 1.5 Technical Report
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2511.18870