Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Jeongsoo, Niu, Zhikang, Kim, Ji-Hoon, Wang, Chunhui, Chung, Joon Son, Chen, Xie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024)
par: Nguyen, Tan Dat, et autres
Publié: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024)
par: Jung, Chaeyoung, et autres
Publié: (2024)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025)
par: Kim, Ji-Hoon, et autres
Publié: (2025)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
par: Zheng, Qixi, et autres
Publié: (2025)
par: Zheng, Qixi, et autres
Publié: (2025)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
par: Kwak, Doyeop, et autres
Publié: (2025)
par: Kwak, Doyeop, et autres
Publié: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
par: Kim, Ji-Hoon, et autres
Publié: (2023)
par: Kim, Ji-Hoon, et autres
Publié: (2023)
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
par: Nguyen, Tan Dat, et autres
Publié: (2025)
par: Nguyen, Tan Dat, et autres
Publié: (2025)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
par: Chen, Yushen, et autres
Publié: (2024)
par: Chen, Yushen, et autres
Publié: (2024)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
par: Yang, Jinhyeok, et autres
Publié: (2024)
par: Yang, Jinhyeok, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation
par: Kim, Ji-Hoon, et autres
Publié: (2024)
par: Kim, Ji-Hoon, et autres
Publié: (2024)
Lightweight Audio Segmentation for Long-form Speech Translation
par: Lee, Jaesong, et autres
Publié: (2024)
par: Lee, Jaesong, et autres
Publié: (2024)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
par: Kim, Jaehun, et autres
Publié: (2025)
par: Kim, Jaehun, et autres
Publié: (2025)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
par: Sakpiboonchit, Siratish
Publié: (2025)
par: Sakpiboonchit, Siratish
Publié: (2025)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025)
par: Pham, The Hieu, et autres
Publié: (2025)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
par: Nam, KiHyun, et autres
Publié: (2025)
par: Nam, KiHyun, et autres
Publié: (2025)
Adversarial Training of Denoising Diffusion Model Using Dual Discriminators for High-Fidelity Multi-Speaker TTS
par: Ko, Myeongjin, et autres
Publié: (2023)
par: Ko, Myeongjin, et autres
Publié: (2023)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
par: Zhang, Kang, et autres
Publié: (2025)
par: Zhang, Kang, et autres
Publié: (2025)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
par: Chung, Raymond
Publié: (2026)
par: Chung, Raymond
Publié: (2026)
DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
par: Kim, Jaehyeon, et autres
Publié: (2024)
par: Kim, Jaehyeon, et autres
Publié: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
par: Lam, Perry, et autres
Publié: (2022)
par: Lam, Perry, et autres
Publié: (2022)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
par: Xia, Kangxiang, et autres
Publié: (2025)
par: Xia, Kangxiang, et autres
Publié: (2025)
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
par: Niu, Zhikang, et autres
Publié: (2025)
par: Niu, Zhikang, et autres
Publié: (2025)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
par: Chung, Soo-Whan, et autres
Publié: (2025)
par: Chung, Soo-Whan, et autres
Publié: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
par: Ryu, Hyeonggon, et autres
Publié: (2025)
par: Ryu, Hyeonggon, et autres
Publié: (2025)
Documents similaires
-
Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing
par: Choi, Jeongsoo, et autres
Publié: (2025) -
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
par: Nguyen, Tan Dat, et autres
Publié: (2024) -
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024) -
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
par: Jung, Chaeyoung, et autres
Publié: (2024) -
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
par: Kim, Ji-Hoon, et autres
Publié: (2025)