Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zehua, He, Guande, Zheng, Kaiwen, Tan, Xu, Zhu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Bridge-SR: Schrödinger Bridge for Efficient SR
por: Li, Chang, et al.
Publicado: (2025)
por: Li, Chang, et al.
Publicado: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Investigating the Design Space of Diffusion Models for Speech Enhancement
por: Gonzalez, Philippe, et al.
Publicado: (2023)
por: Gonzalez, Philippe, et al.
Publicado: (2023)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis
por: Lin, Weiwei, et al.
Publicado: (2025)
por: Lin, Weiwei, et al.
Publicado: (2025)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
por: Melechovsky, Jan, et al.
Publicado: (2022)
por: Melechovsky, Jan, et al.
Publicado: (2022)
Generative Semantic Communication for Text-to-Speech Synthesis
por: Zheng, Jiahao, et al.
Publicado: (2024)
por: Zheng, Jiahao, et al.
Publicado: (2024)
Schrödinger Bridge Mamba for One-Step Speech Enhancement
por: Yang, Jing, et al.
Publicado: (2025)
por: Yang, Jing, et al.
Publicado: (2025)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Diffusion-Based Speech Enhancement in Matched and Mismatched Conditions Using a Heun-Based Sampler
por: Gonzalez, Philippe, et al.
Publicado: (2023)
por: Gonzalez, Philippe, et al.
Publicado: (2023)
Speech to Speech Synthesis for Voice Impersonation
por: Johnson, Bjorn, et al.
Publicado: (2026)
por: Johnson, Bjorn, et al.
Publicado: (2026)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Investigating the Effects of Diffusion-based Conditional Generative Speech Models Used for Speech Enhancement on Dysarthric Speech
por: Reszka, Joanna, et al.
Publicado: (2024)
por: Reszka, Joanna, et al.
Publicado: (2024)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2025)
por: Jiang, Ziyue, et al.
Publicado: (2025)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
por: Zhang, Leying, et al.
Publicado: (2023)
por: Zhang, Leying, et al.
Publicado: (2023)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
por: Richter, Julius, et al.
Publicado: (2022)
por: Richter, Julius, et al.
Publicado: (2022)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Diffusion Synthesizer for Efficient Multilingual Speech to Speech Translation
por: Hirschkind, Nameer, et al.
Publicado: (2024)
por: Hirschkind, Nameer, et al.
Publicado: (2024)
Posterior Transition Modeling for Unsupervised Diffusion-Based Speech Enhancement
por: Sadeghi, Mostafa, et al.
Publicado: (2025)
por: Sadeghi, Mostafa, et al.
Publicado: (2025)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis
por: Baoueb, Teysir, et al.
Publicado: (2025)
por: Baoueb, Teysir, et al.
Publicado: (2025)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
por: Lin, Weiwei, et al.
Publicado: (2024)
por: Lin, Weiwei, et al.
Publicado: (2024)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
por: Agrawal, Prabhav, et al.
Publicado: (2024)
por: Agrawal, Prabhav, et al.
Publicado: (2024)
Beat this! Accurate beat tracking without DBN postprocessing
por: Foscarin, Francesco, et al.
Publicado: (2024)
por: Foscarin, Francesco, et al.
Publicado: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
por: Khanagha, Sina, et al.
Publicado: (2026)
por: Khanagha, Sina, et al.
Publicado: (2026)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
por: Jiang, Xilin, et al.
Publicado: (2024)
por: Jiang, Xilin, et al.
Publicado: (2024)
Zero-Shot Mono-to-Binaural Speech Synthesis
por: Levkovitch, Alon, et al.
Publicado: (2024)
por: Levkovitch, Alon, et al.
Publicado: (2024)
On the Semantic Latent Space of Diffusion-Based Text-to-Speech Models
por: Varshavsky-Hassid, Miri, et al.
Publicado: (2024)
por: Varshavsky-Hassid, Miri, et al.
Publicado: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Diffusion Buffer for Online Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2025)
por: Lay, Bunlong, et al.
Publicado: (2025)
An Analysis of the Variance of Diffusion-based Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap
por: Mo, Shentong, et al.
Publicado: (2025)
por: Mo, Shentong, et al.
Publicado: (2025)
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
por: Postolache, Emilian, et al.
Publicado: (2024)
por: Postolache, Emilian, et al.
Publicado: (2024)
ASTRA: Aligning Speech and Text Representations for Asr without Sampling
por: Gaur, Neeraj, et al.
Publicado: (2024)
por: Gaur, Neeraj, et al.
Publicado: (2024)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
por: Yang, Yudong, et al.
Publicado: (2024)
por: Yang, Yudong, et al.
Publicado: (2024)
Ejemplares similares
-
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025) -
Bridge-SR: Schrödinger Bridge for Efficient SR
por: Li, Chang, et al.
Publicado: (2025) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025) -
Investigating the Design Space of Diffusion Models for Speech Enhancement
por: Gonzalez, Philippe, et al.
Publicado: (2023) -
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)