Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yifan, Liu, Shujie, Li, Jinyu, Hu, Yuxuan, Wu, Haibin, Wang, Hui, Yu, Jianwei, Meng, Lingwei, Sun, Haiyang, Liu, Yanqing, Lu, Yan, Yu, Kai, Chen, Xie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
por: Chen, Sanyuan, et al.
Publicado: (2024)
por: Chen, Sanyuan, et al.
Publicado: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
por: Pei, Hanchen, et al.
Publicado: (2026)
por: Pei, Hanchen, et al.
Publicado: (2026)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
por: Han, Bing, et al.
Publicado: (2024)
por: Han, Bing, et al.
Publicado: (2024)
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
Position: Towards Responsible Evaluation for Text-to-Speech
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
por: Nishimura, Yuto, et al.
Publicado: (2024)
por: Nishimura, Yuto, et al.
Publicado: (2024)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
TS3-Codec: Transformer-Based Simple Streaming Single Codec
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
por: Langman, Ryan, et al.
Publicado: (2024)
por: Langman, Ryan, et al.
Publicado: (2024)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2024)
por: Lu, Ye-Xin, et al.
Publicado: (2024)
Debatts: Zero-Shot Debating Text-to-Speech Synthesis
por: Huang, Yiqiao, et al.
Publicado: (2024)
por: Huang, Yiqiao, et al.
Publicado: (2024)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
por: Wu, Haibin, et al.
Publicado: (2025)
por: Wu, Haibin, et al.
Publicado: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
por: Wang, Xiaofei, et al.
Publicado: (2023)
por: Wang, Xiaofei, et al.
Publicado: (2023)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
por: Wang, Yuancheng, et al.
Publicado: (2024)
por: Wang, Yuancheng, et al.
Publicado: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
por: Yuan, Ze, et al.
Publicado: (2024)
por: Yuan, Ze, et al.
Publicado: (2024)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Benchmarking Neural Speech Codec Intelligibility with SITool
por: Leschanowsky, Anna, et al.
Publicado: (2025)
por: Leschanowsky, Anna, et al.
Publicado: (2025)
Codec-SUPERB: An In-Depth Analysis of Sound Codec Models
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
por: Niu, Zhikang, et al.
Publicado: (2024)
por: Niu, Zhikang, et al.
Publicado: (2024)
Ejemplares similares
-
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024) -
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025) -
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
por: Chen, Sanyuan, et al.
Publicado: (2024) -
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
por: Pei, Hanchen, et al.
Publicado: (2026) -
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)