Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Weiwei, He, Chenghan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
di: Della Libera, Luca, et al.
Pubblicazione: (2025)
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
di: Chen, Zehua, et al.
Pubblicazione: (2023)
di: Chen, Zehua, et al.
Pubblicazione: (2023)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2022)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2022)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance
di: Luong, Diep, et al.
Pubblicazione: (2025)
di: Luong, Diep, et al.
Pubblicazione: (2025)
Parallel Synthesis for Autoregressive Speech Generation
di: Hsu, Po-chun, et al.
Pubblicazione: (2022)
di: Hsu, Po-chun, et al.
Pubblicazione: (2022)
Zero-Shot Mono-to-Binaural Speech Synthesis
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
di: Levkovitch, Alon, et al.
Pubblicazione: (2024)
Safeguarding Privacy in Edge Speech Understanding with Tiny Foundation Models
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
di: Benazir, Afsara, et al.
Pubblicazione: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
di: Kwon, Taegyun, et al.
Pubblicazione: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
di: Ji, Shengpeng, et al.
Pubblicazione: (2023)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
di: Reszka, Joanna, et al.
Pubblicazione: (2024)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
di: de Oliveira, Danilo, et al.
Pubblicazione: (2024)
Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models
di: Feng, Chen, et al.
Pubblicazione: (2025)
di: Feng, Chen, et al.
Pubblicazione: (2025)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
Continuous Autoregressive Models with Noise Augmentation Avoid Error Accumulation
di: Pasini, Marco, et al.
Pubblicazione: (2024)
di: Pasini, Marco, et al.
Pubblicazione: (2024)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
Losses Can Be Blessings: Routing Self-Supervised Speech Representations Towards Efficient Multilingual and Multitask Speech Processing
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
di: Fu, Yonggan, et al.
Pubblicazione: (2022)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
Gradient Norm-based Fine-Tuning for Backdoor Defense in Automatic Speech Recognition
di: Zhou, Nanjun, et al.
Pubblicazione: (2025)
di: Zhou, Nanjun, et al.
Pubblicazione: (2025)
Are Deep Speech Denoising Models Robust to Adversarial Noise?
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
Investigating the Design Space of Diffusion Models for Speech Enhancement
di: Gonzalez, Philippe, et al.
Pubblicazione: (2023)
di: Gonzalez, Philippe, et al.
Pubblicazione: (2023)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
di: Zhang, Leying, et al.
Pubblicazione: (2023)
di: Zhang, Leying, et al.
Pubblicazione: (2023)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
di: Richter, Julius, et al.
Pubblicazione: (2022)
di: Richter, Julius, et al.
Pubblicazione: (2022)
GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
di: Baoueb, Teysir, et al.
Pubblicazione: (2025)
Impact of Speech Mode in Automatic Pathological Speech Detection
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
di: Sheikh, Shakeel A., et al.
Pubblicazione: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
di: Hirschkind, Nameer, et al.
Pubblicazione: (2024)
MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2025)
Posterior Transition Modeling for Unsupervised Diffusion-Based Speech Enhancement
di: Sadeghi, Mostafa, et al.
Pubblicazione: (2025)
di: Sadeghi, Mostafa, et al.
Pubblicazione: (2025)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
di: Huang, Zhichao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
di: Lin, Weiwei, et al.
Pubblicazione: (2024) -
Autoregressive Speech Enhancement via Acoustic Tokens
di: Della Libera, Luca, et al.
Pubblicazione: (2025) -
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
di: Chen, Zehua, et al.
Pubblicazione: (2023) -
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026) -
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)