Step-Audio 2 Technical Report
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866918131501367296 |
|---|---|
| author | Wu, Boyong Yan, Chao Hu, Chen Yi, Cheng Feng, Chengli Tian, Fei Shen, Feiyu Yu, Gang Zhang, Haoyang Li, Jingbei Chen, Mingrui Liu, Peng You, Wang Zhang, Xiangyu Tony Li, Xingyuan Yang, Xuerui Deng, Yayue Huang, Yechang Li, Yuxin Zhang, Yuxin You, Zhao Li, Brian Wan, Changyi Hu, Hanpeng Zhen, Jiangjie Chen, Siyu Yuan, Song Zhang, Xuelin Jiang, Yimin Zhou, Yu Yang, Yuxiang Li, Bingxin Ma, Buyun Song, Changhe Pang, Dongqing Hu, Guoqiang Sun, Haiyang An, Kang Wang, Na Gao, Shuli Ji, Wei Li, Wen Sun, Wen Wen, Xuan Ren, Yong Ma, Yuankai Lu, Yufan Wang, Bin Li, Bo Miao, Changxin Liu, Che Xu, Chen Shi, Dapeng Hu, Dingyuan Wu, Donghang Liu, Enle Huang, Guanzhe Yan, Gulin Zhang, Han Nie, Hao Jia, Haonan Zhou, Hongyu Sun, Jianjian Wu, Jiaoren Wu, Jie Yang, Jie Yang, Jin Lin, Junzhe Li, Kaixiang Yang, Lei Shi, Liying Zhou, Li Gu, Longlong Li, Ming Li, Mingliang Li, Mingxiao Wu, Nan Han, Qi Tan, Qinyuan Pang, Shaoliang Fan, Shengjie Liu, Siqi Cao, Tiancheng Lu, Wanying He, Wenqing Xie, Wuxun Zhao, Xu Li, Xueqi Yu, Yanbo Yang, Yang Liu, Yi Lu, Yifan Wang, Yilei Ding, Yuanhao Liang, Yuanwei Lu, Yuanwei Luo, Yuchu Yin, Yuhe Zhan, Yumeng Zhang, Yuxiang Yang, Zidong Zhang, Zixin Jiao, Binxing Jiang, Daxin Shum, Heung-Yeung Chen, Jiansheng Li, Jing Zhang, Xiangyu Zhu, Yibo |
| author_facet | Wu, Boyong Yan, Chao Hu, Chen Yi, Cheng Feng, Chengli Tian, Fei Shen, Feiyu Yu, Gang Zhang, Haoyang Li, Jingbei Chen, Mingrui Liu, Peng You, Wang Zhang, Xiangyu Tony Li, Xingyuan Yang, Xuerui Deng, Yayue Huang, Yechang Li, Yuxin Zhang, Yuxin You, Zhao Li, Brian Wan, Changyi Hu, Hanpeng Zhen, Jiangjie Chen, Siyu Yuan, Song Zhang, Xuelin Jiang, Yimin Zhou, Yu Yang, Yuxiang Li, Bingxin Ma, Buyun Song, Changhe Pang, Dongqing Hu, Guoqiang Sun, Haiyang An, Kang Wang, Na Gao, Shuli Ji, Wei Li, Wen Sun, Wen Wen, Xuan Ren, Yong Ma, Yuankai Lu, Yufan Wang, Bin Li, Bo Miao, Changxin Liu, Che Xu, Chen Shi, Dapeng Hu, Dingyuan Wu, Donghang Liu, Enle Huang, Guanzhe Yan, Gulin Zhang, Han Nie, Hao Jia, Haonan Zhou, Hongyu Sun, Jianjian Wu, Jiaoren Wu, Jie Yang, Jie Yang, Jin Lin, Junzhe Li, Kaixiang Yang, Lei Shi, Liying Zhou, Li Gu, Longlong Li, Ming Li, Mingliang Li, Mingxiao Wu, Nan Han, Qi Tan, Qinyuan Pang, Shaoliang Fan, Shengjie Liu, Siqi Cao, Tiancheng Lu, Wanying He, Wenqing Xie, Wuxun Zhao, Xu Li, Xueqi Yu, Yanbo Yang, Yang Liu, Yi Lu, Yifan Wang, Yilei Ding, Yuanhao Liang, Yuanwei Lu, Yuanwei Luo, Yuchu Yin, Yuhe Zhan, Yumeng Zhang, Yuxiang Yang, Zidong Zhang, Zixin Jiao, Binxing Jiang, Daxin Shum, Heung-Yeung Chen, Jiansheng Li, Jing Zhang, Xiangyu Zhu, Yibo |
| contents | This paper presents Step-Audio 2, an end-to-end multi-modal large language model designed for industry-strength audio understanding and speech conversation. By integrating a latent audio encoder and reasoning-centric reinforcement learning (RL), Step-Audio 2 achieves promising performance in automatic speech recognition (ASR) and audio understanding. To facilitate genuine end-to-end speech conversation, Step-Audio 2 incorporates the generation of discrete audio tokens into language modeling, significantly enhancing its responsiveness to paralinguistic information such as speaking styles and emotions. To effectively leverage the rich textual and acoustic knowledge in real-world data, Step-Audio 2 integrates retrieval-augmented generation (RAG) and is able to call external tools such as web search to mitigate hallucination and audio search to switch timbres. Trained on millions of hours of speech and audio data, Step-Audio 2 delivers intelligence and expressiveness across diverse conversational scenarios. Evaluation results demonstrate that Step-Audio 2 achieves state-of-the-art performance on various audio understanding and conversational benchmarks compared to other open-source and commercial solutions. Please visit https://github.com/stepfun-ai/Step-Audio2 for more information. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2507_16632 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | Step-Audio 2 Technical Report Wu, Boyong Yan, Chao Hu, Chen Yi, Cheng Feng, Chengli Tian, Fei Shen, Feiyu Yu, Gang Zhang, Haoyang Li, Jingbei Chen, Mingrui Liu, Peng You, Wang Zhang, Xiangyu Tony Li, Xingyuan Yang, Xuerui Deng, Yayue Huang, Yechang Li, Yuxin Zhang, Yuxin You, Zhao Li, Brian Wan, Changyi Hu, Hanpeng Zhen, Jiangjie Chen, Siyu Yuan, Song Zhang, Xuelin Jiang, Yimin Zhou, Yu Yang, Yuxiang Li, Bingxin Ma, Buyun Song, Changhe Pang, Dongqing Hu, Guoqiang Sun, Haiyang An, Kang Wang, Na Gao, Shuli Ji, Wei Li, Wen Sun, Wen Wen, Xuan Ren, Yong Ma, Yuankai Lu, Yufan Wang, Bin Li, Bo Miao, Changxin Liu, Che Xu, Chen Shi, Dapeng Hu, Dingyuan Wu, Donghang Liu, Enle Huang, Guanzhe Yan, Gulin Zhang, Han Nie, Hao Jia, Haonan Zhou, Hongyu Sun, Jianjian Wu, Jiaoren Wu, Jie Yang, Jie Yang, Jin Lin, Junzhe Li, Kaixiang Yang, Lei Shi, Liying Zhou, Li Gu, Longlong Li, Ming Li, Mingliang Li, Mingxiao Wu, Nan Han, Qi Tan, Qinyuan Pang, Shaoliang Fan, Shengjie Liu, Siqi Cao, Tiancheng Lu, Wanying He, Wenqing Xie, Wuxun Zhao, Xu Li, Xueqi Yu, Yanbo Yang, Yang Liu, Yi Lu, Yifan Wang, Yilei Ding, Yuanhao Liang, Yuanwei Lu, Yuanwei Luo, Yuchu Yin, Yuhe Zhan, Yumeng Zhang, Yuxiang Yang, Zidong Zhang, Zixin Jiao, Binxing Jiang, Daxin Shum, Heung-Yeung Chen, Jiansheng Li, Jing Zhang, Xiangyu Zhu, Yibo Computation and Language Sound Audio and Speech Processing This paper presents Step-Audio 2, an end-to-end multi-modal large language model designed for industry-strength audio understanding and speech conversation. By integrating a latent audio encoder and reasoning-centric reinforcement learning (RL), Step-Audio 2 achieves promising performance in automatic speech recognition (ASR) and audio understanding. To facilitate genuine end-to-end speech conversation, Step-Audio 2 incorporates the generation of discrete audio tokens into language modeling, significantly enhancing its responsiveness to paralinguistic information such as speaking styles and emotions. To effectively leverage the rich textual and acoustic knowledge in real-world data, Step-Audio 2 integrates retrieval-augmented generation (RAG) and is able to call external tools such as web search to mitigate hallucination and audio search to switch timbres. Trained on millions of hours of speech and audio data, Step-Audio 2 delivers intelligence and expressiveness across diverse conversational scenarios. Evaluation results demonstrate that Step-Audio 2 achieves state-of-the-art performance on various audio understanding and conversational benchmarks compared to other open-source and commercial solutions. Please visit https://github.com/stepfun-ai/Step-Audio2 for more information. |
| title | Step-Audio 2 Technical Report |
| topic | Computation and Language Sound Audio and Speech Processing |
| url | https://arxiv.org/abs/2507.16632 |