Robust and Unbounded Length Generalization in Autoregressive Transformer-Based Text-to-Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Battenberg, Eric, Skerry-Ryan, RJ, Stanton, Daisy, Mariooryad, Soroosh, Shannon, Matt, Salazar, Julian, Kao, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-Shot Mono-to-Binaural Speech Synthesis
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
SequenceLayers: Sequence Processing and Streaming Neural Networks Made Easy
di: Skerry-Ryan, RJ, et al.
Pubblicazione: (2025)
di: Skerry-Ryan, RJ, et al.
Pubblicazione: (2025)
Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024)
di: Park, Se Jin, et al.
Pubblicazione: (2024)
Parallel Synthesis for Autoregressive Speech Generation
di: Hsu, Po-chun, et al.
Pubblicazione: (2022)
di: Hsu, Po-chun, et al.
Pubblicazione: (2022)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
di: Du, Chenpeng, et al.
Pubblicazione: (2024)
di: Du, Chenpeng, et al.
Pubblicazione: (2024)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
di: Lin, Jackie, et al.
Pubblicazione: (2026)
di: Lin, Jackie, et al.
Pubblicazione: (2026)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
di: Wang, Hankun, et al.
Pubblicazione: (2024)
di: Wang, Hankun, et al.
Pubblicazione: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
di: Liu, Huadai, et al.
Pubblicazione: (2023)
di: Liu, Huadai, et al.
Pubblicazione: (2023)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
di: Lou, Haowei, et al.
Pubblicazione: (2025)
di: Lou, Haowei, et al.
Pubblicazione: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
di: Ahmad, Hawraz A., et al.
Pubblicazione: (2024)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
Combined Generative and Predictive Modeling for Speech Super-resolution
di: Wang, Heming, et al.
Pubblicazione: (2024)
di: Wang, Heming, et al.
Pubblicazione: (2024)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
Zero-Shot Text-to-Speech from Continuous Text Streams
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction Policy
di: Li, Bohan, et al.
Pubblicazione: (2025)
di: Li, Bohan, et al.
Pubblicazione: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
EmoFormer: A Text-Independent Speech Emotion Recognition using a Hybrid Transformer-CNN model
di: Hasan, Rashedul, et al.
Pubblicazione: (2025)
di: Hasan, Rashedul, et al.
Pubblicazione: (2025)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024)
di: Giraldo, José, et al.
Pubblicazione: (2024)
Semantic MIMO Systems for Speech-to-Text Transmission
di: Weng, Zhenzi, et al.
Pubblicazione: (2024)
di: Weng, Zhenzi, et al.
Pubblicazione: (2024)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
di: Lei, Ke, et al.
Pubblicazione: (2026)
di: Lei, Ke, et al.
Pubblicazione: (2026)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
di: Liao, Shijia, et al.
Pubblicazione: (2024)
di: Liao, Shijia, et al.
Pubblicazione: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Zero-Shot Mono-to-Binaural Speech Synthesis
di: Levkovitch, Alon, et al.
Pubblicazione: (2024) -
SequenceLayers: Sequence Processing and Streaming Neural Networks Made Easy
di: Skerry-Ryan, RJ, et al.
Pubblicazione: (2025) -
Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM
di: Nachmani, Eliya, et al.
Pubblicazione: (2023) -
Long-Form Speech Generation with Spoken Language Models
di: Park, Se Jin, et al.
Pubblicazione: (2024) -
Parallel Synthesis for Autoregressive Speech Generation
di: Hsu, Po-chun, et al.
Pubblicazione: (2022)