Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Bai, Ye, Chen, Jingping, Chen, Jitong, Chen, Wei, Chen, Zhuo, Ding, Chuang, Dong, Linhao, Dong, Qianqian, Du, Yujiao, Gao, Kepan, Gao, Lu, Guo, Yi, Han, Minglun, Han, Ting, Hu, Wenchao, Hu, Xinying, Hu, Yuxiang, Hua, Deyu, Huang, Lu, Huang, Mingkun, Huang, Youjia, Jin, Jishuo, Kong, Fanliu, Lan, Zongwei, Li, Tianyu, Li, Xiaoyang, Li, Zeyang, Lin, Zehua, Liu, Rui, Liu, Shouda, Lu, Lu, Lu, Yizhou, Ma, Jingting, Ma, Shengtao, Pei, Yulin, Shen, Chen, Tan, Tian, Tian, Xiaogang, Tu, Ming, Wang, Bo, Wang, Hao, Wang, Yuping, Wang, Yuxuan, Xia, Hanzhang, Xia, Rui, Xie, Shuangyi, Xu, Hongmin, Yang, Meng, Zhang, Bihong, Zhang, Jun, Zhang, Wanyi, Zhang, Yang, Zhang, Yawei, Zheng, Yijie, Zou, Ming
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866929415575830528
author Bai, Ye
Chen, Jingping
Chen, Jitong
Chen, Wei
Chen, Zhuo
Ding, Chuang
Dong, Linhao
Dong, Qianqian
Du, Yujiao
Gao, Kepan
Gao, Lu
Guo, Yi
Han, Minglun
Han, Ting
Hu, Wenchao
Hu, Xinying
Hu, Yuxiang
Hua, Deyu
Huang, Lu
Huang, Mingkun
Huang, Youjia
Jin, Jishuo
Kong, Fanliu
Lan, Zongwei
Li, Tianyu
Li, Xiaoyang
Li, Zeyang
Lin, Zehua
Liu, Rui
Liu, Shouda
Lu, Lu
Lu, Yizhou
Ma, Jingting
Ma, Shengtao
Pei, Yulin
Shen, Chen
Tan, Tian
Tian, Xiaogang
Tu, Ming
Wang, Bo
Wang, Hao
Wang, Yuping
Wang, Yuxuan
Xia, Hanzhang
Xia, Rui
Xie, Shuangyi
Xu, Hongmin
Yang, Meng
Zhang, Bihong
Zhang, Jun
Zhang, Wanyi
Zhang, Yang
Zhang, Yawei
Zheng, Yijie
Zou, Ming
author_facet Bai, Ye
Chen, Jingping
Chen, Jitong
Chen, Wei
Chen, Zhuo
Ding, Chuang
Dong, Linhao
Dong, Qianqian
Du, Yujiao
Gao, Kepan
Gao, Lu
Guo, Yi
Han, Minglun
Han, Ting
Hu, Wenchao
Hu, Xinying
Hu, Yuxiang
Hua, Deyu
Huang, Lu
Huang, Mingkun
Huang, Youjia
Jin, Jishuo
Kong, Fanliu
Lan, Zongwei
Li, Tianyu
Li, Xiaoyang
Li, Zeyang
Lin, Zehua
Liu, Rui
Liu, Shouda
Lu, Lu
Lu, Yizhou
Ma, Jingting
Ma, Shengtao
Pei, Yulin
Shen, Chen
Tan, Tian
Tian, Xiaogang
Tu, Ming
Wang, Bo
Wang, Hao
Wang, Yuping
Wang, Yuxuan
Xia, Hanzhang
Xia, Rui
Xie, Shuangyi
Xu, Hongmin
Yang, Meng
Zhang, Bihong
Zhang, Jun
Zhang, Wanyi
Zhang, Yang
Zhang, Yawei
Zheng, Yijie
Zou, Ming
contents Modern automatic speech recognition (ASR) model is required to accurately transcribe diverse speech signals (from different domains, languages, accents, etc) given the specific contextual information in various application scenarios. Classic end-to-end models fused with extra language models perform well, but mainly in data matching scenarios and are gradually approaching a bottleneck. In this work, we introduce Seed-ASR, a large language model (LLM) based speech recognition model. Seed-ASR is developed based on the framework of audio conditioned LLM (AcLLM), leveraging the capabilities of LLMs by inputting continuous speech representations together with contextual information into the LLM. Through stage-wise large-scale training and the elicitation of context-aware capabilities in LLM, Seed-ASR demonstrates significant improvement over end-to-end models on comprehensive evaluation sets, including multiple domains, accents/dialects and languages. Additionally, Seed-ASR can be further deployed to support specific needs in various scenarios without requiring extra language models. Compared to recently released large ASR models, Seed-ASR achieves 10%-40% reduction in word (or character, for Chinese) error rates on Chinese and English public test sets, further demonstrating its powerful performance.
format Preprint
id arxiv_https___arxiv_org_abs_2407_04675
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
Bai, Ye
Chen, Jingping
Chen, Jitong
Chen, Wei
Chen, Zhuo
Ding, Chuang
Dong, Linhao
Dong, Qianqian
Du, Yujiao
Gao, Kepan
Gao, Lu
Guo, Yi
Han, Minglun
Han, Ting
Hu, Wenchao
Hu, Xinying
Hu, Yuxiang
Hua, Deyu
Huang, Lu
Huang, Mingkun
Huang, Youjia
Jin, Jishuo
Kong, Fanliu
Lan, Zongwei
Li, Tianyu
Li, Xiaoyang
Li, Zeyang
Lin, Zehua
Liu, Rui
Liu, Shouda
Lu, Lu
Lu, Yizhou
Ma, Jingting
Ma, Shengtao
Pei, Yulin
Shen, Chen
Tan, Tian
Tian, Xiaogang
Tu, Ming
Wang, Bo
Wang, Hao
Wang, Yuping
Wang, Yuxuan
Xia, Hanzhang
Xia, Rui
Xie, Shuangyi
Xu, Hongmin
Yang, Meng
Zhang, Bihong
Zhang, Jun
Zhang, Wanyi
Zhang, Yang
Zhang, Yawei
Zheng, Yijie
Zou, Ming
Audio and Speech Processing
Sound
Modern automatic speech recognition (ASR) model is required to accurately transcribe diverse speech signals (from different domains, languages, accents, etc) given the specific contextual information in various application scenarios. Classic end-to-end models fused with extra language models perform well, but mainly in data matching scenarios and are gradually approaching a bottleneck. In this work, we introduce Seed-ASR, a large language model (LLM) based speech recognition model. Seed-ASR is developed based on the framework of audio conditioned LLM (AcLLM), leveraging the capabilities of LLMs by inputting continuous speech representations together with contextual information into the LLM. Through stage-wise large-scale training and the elicitation of context-aware capabilities in LLM, Seed-ASR demonstrates significant improvement over end-to-end models on comprehensive evaluation sets, including multiple domains, accents/dialects and languages. Additionally, Seed-ASR can be further deployed to support specific needs in various scenarios without requiring extra language models. Compared to recently released large ASR models, Seed-ASR achieves 10%-40% reduction in word (or character, for Chinese) error rates on Chinese and English public test sets, further demonstrating its powerful performance.
title Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
topic Audio and Speech Processing
Sound
url https://arxiv.org/abs/2407.04675