Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Haiyang, Hu, Shujie, Liu, Shujie, Meng, Lingwei, Wang, Hui, Han, Bing, Yang, Yifan, Liu, Yanqing, Zhao, Sheng, Lu, Yan, Qian, Yanmin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
por: Han, Bing, et al.
Publicado: (2024)
por: Han, Bing, et al.
Publicado: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
por: Chen, Sanyuan, et al.
Publicado: (2024)
por: Chen, Sanyuan, et al.
Publicado: (2024)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
por: Yuan, Ze, et al.
Publicado: (2024)
por: Yuan, Ze, et al.
Publicado: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
por: Pei, Hanchen, et al.
Publicado: (2026)
por: Pei, Hanchen, et al.
Publicado: (2026)
Position: Towards Responsible Evaluation for Text-to-Speech
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
CoVoMix: Advancing Zero-Shot Speech Generation for Human-like Multi-talker Conversations
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Next Tokens Denoising for Speech Synthesis
por: Liu, Yanqing, et al.
Publicado: (2025)
por: Liu, Yanqing, et al.
Publicado: (2025)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2024)
por: Lu, Ye-Xin, et al.
Publicado: (2024)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
por: Hu, Shujie, et al.
Publicado: (2024)
por: Hu, Shujie, et al.
Publicado: (2024)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
por: Cui, Mingyu, et al.
Publicado: (2025)
por: Cui, Mingyu, et al.
Publicado: (2025)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
por: Zhang, Leying, et al.
Publicado: (2023)
por: Zhang, Leying, et al.
Publicado: (2023)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
Risk Factors of Thrombocytopenia After Cardiac Surgery with Cardiopulmonary Bypass
por: Shujie Yan
Publicado: (2023)
por: Shujie Yan
Publicado: (2023)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
por: Le, Chenyang, et al.
Publicado: (2024)
por: Le, Chenyang, et al.
Publicado: (2024)
Transfer Learning for High Dimensional Robust Regression
por: Yuan, Xiaohui, et al.
Publicado: (2024)
por: Yuan, Xiaohui, et al.
Publicado: (2024)
Zero-Shot Text-to-Speech from Continuous Text Streams
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation
por: Li, Zongyi, et al.
Publicado: (2024)
por: Li, Zongyi, et al.
Publicado: (2024)
AlignFormer: Modality Matching Can Achieve Better Zero-shot Instruction-Following Speech-LLM
por: Fan, Ruchao, et al.
Publicado: (2024)
por: Fan, Ruchao, et al.
Publicado: (2024)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
por: Xu, Hainan, et al.
Publicado: (2026)
por: Xu, Hainan, et al.
Publicado: (2026)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness
por: Yu, Lu, et al.
Publicado: (2026)
por: Yu, Lu, et al.
Publicado: (2026)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Debatts: Zero-Shot Debating Text-to-Speech Synthesis
por: Huang, Yiqiao, et al.
Publicado: (2024)
por: Huang, Yiqiao, et al.
Publicado: (2024)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
por: Zhong, Tao, et al.
Publicado: (2025)
por: Zhong, Tao, et al.
Publicado: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
por: Kanda, Naoyuki, et al.
Publicado: (2024)
por: Kanda, Naoyuki, et al.
Publicado: (2024)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
Anti-Disturbance Hierarchical Sliding Mode Controller for Deep-Sea Cranes with Adaptive Control and Neural Network Compensation
por: Zuo, Qian, et al.
Publicado: (2025)
por: Zuo, Qian, et al.
Publicado: (2025)
Ejemplares similares
-
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
por: Han, Bing, et al.
Publicado: (2024) -
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2025) -
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
por: Wang, Hui, et al.
Publicado: (2025) -
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024) -
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)