Sample-Efficient Diffusion for Text-To-Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lovelace, Justin, Ray, Soham, Kim, Kwangyoun, Weinberger, Kilian Q., Wu, Felix |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Music Transcription with (Almost) No Supervision
par: Shin, Saebyeol, et autres
Publié: (2026)
par: Shin, Saebyeol, et autres
Publié: (2026)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
Causal Prosody Mediation for Text-to-Speech:Counterfactual Training of Duration, Pitch, and Energy in FastSpeech2
par: Mohanty, Suvendu Sekhar
Publié: (2026)
par: Mohanty, Suvendu Sekhar
Publié: (2026)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
par: Lee, Keon, et autres
Publié: (2024)
par: Lee, Keon, et autres
Publié: (2024)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
par: Ye, Zhen, et autres
Publié: (2024)
par: Ye, Zhen, et autres
Publié: (2024)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
SafeSpeech: Robust and Universal Voice Protection Against Malicious Speech Synthesis
par: Zhang, Zhisheng, et autres
Publié: (2025)
par: Zhang, Zhisheng, et autres
Publié: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
par: Ju, Zeqian, et autres
Publié: (2024)
par: Ju, Zeqian, et autres
Publié: (2024)
NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations
par: Liao, Huan, et autres
Publié: (2025)
par: Liao, Huan, et autres
Publié: (2025)
Split and Conquer Partial Deepfake Speech
par: Rimon, Inbal, et autres
Publié: (2026)
par: Rimon, Inbal, et autres
Publié: (2026)
MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Collaborative Watermarking for Adversarial Speech Synthesis
par: Juvela, Lauri, et autres
Publié: (2023)
par: Juvela, Lauri, et autres
Publié: (2023)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
Scaling Speech Tokenizers with Diffusion Autoencoders
par: Wang, Yuancheng, et autres
Publié: (2026)
par: Wang, Yuancheng, et autres
Publié: (2026)
E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
par: Zhang, Zhisheng, et autres
Publié: (2025)
par: Zhang, Zhisheng, et autres
Publié: (2025)
Adaptive Moments are Surprisingly Effective for Plug-and-Play Diffusion Sampling
par: Belardi, Christian, et autres
Publié: (2026)
par: Belardi, Christian, et autres
Publié: (2026)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
par: Wang, Yuancheng, et autres
Publié: (2024)
par: Wang, Yuancheng, et autres
Publié: (2024)
Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement
par: Cross, Mattias, et autres
Publié: (2025)
par: Cross, Mattias, et autres
Publié: (2025)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
par: Della Libera, Luca, et autres
Publié: (2026)
par: Della Libera, Luca, et autres
Publié: (2026)
Mitigating Unauthorized Speech Synthesis for Voice Protection
par: Zhang, Zhisheng, et autres
Publié: (2024)
par: Zhang, Zhisheng, et autres
Publié: (2024)
DFKI-Speech System for WildSpoof Challenge: A robust framework for SASV In-the-Wild
par: Das, Arnab, et autres
Publié: (2026)
par: Das, Arnab, et autres
Publié: (2026)
Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features
par: Saurav, Kumar
Publié: (2026)
par: Saurav, Kumar
Publié: (2026)
High-Resolution Speech Restoration with Latent Diffusion Model
par: Dhyani, Tushar, et autres
Publié: (2024)
par: Dhyani, Tushar, et autres
Publié: (2024)
Single and Few-step Diffusion for Generative Speech Enhancement
par: Lay, Bunlong, et autres
Publié: (2023)
par: Lay, Bunlong, et autres
Publié: (2023)
Diffusion Guided Language Modeling
par: Lovelace, Justin, et autres
Publié: (2024)
par: Lovelace, Justin, et autres
Publié: (2024)
Pre-training Feature Guided Diffusion Model for Speech Enhancement
par: Yang, Yiyuan, et autres
Publié: (2024)
par: Yang, Yiyuan, et autres
Publié: (2024)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
par: Passoni, Riccardo, et autres
Publié: (2025)
par: Passoni, Riccardo, et autres
Publié: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
Low-Resource Guidance for Controllable Latent Audio Diffusion
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
par: Fang, Linghan, et autres
Publié: (2026)
par: Fang, Linghan, et autres
Publié: (2026)
kNN Retrieval for Simple and Effective Zero-Shot Multi-speaker Text-to-Speech
par: Hajal, Karl El, et autres
Publié: (2024)
par: Hajal, Karl El, et autres
Publié: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music Generation
par: Novack, Zachary, et autres
Publié: (2024)
par: Novack, Zachary, et autres
Publié: (2024)
CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
par: Du, Zhihao, et autres
Publié: (2024)
par: Du, Zhihao, et autres
Publié: (2024)
Hookpad Aria: A Copilot for Songwriters
par: Donahue, Chris, et autres
Publié: (2025)
par: Donahue, Chris, et autres
Publié: (2025)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
par: Peng, Puyuan, et autres
Publié: (2024)
par: Peng, Puyuan, et autres
Publié: (2024)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
par: Kamahori, Keisuke, et autres
Publié: (2025)
par: Kamahori, Keisuke, et autres
Publié: (2025)
Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation
par: Tal, Or, et autres
Publié: (2025)
par: Tal, Or, et autres
Publié: (2025)
Documents similaires
-
Music Transcription with (Almost) No Supervision
par: Shin, Saebyeol, et autres
Publié: (2026) -
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
par: Lou, Yuxuan, et autres
Publié: (2026) -
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
par: Liu, Zhijun, et autres
Publié: (2024) -
Causal Prosody Mediation for Text-to-Speech:Counterfactual Training of Duration, Pitch, and Energy in FastSpeech2
par: Mohanty, Suvendu Sekhar
Publié: (2026) -
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
par: Novack, Zachary, et autres
Publié: (2026)