Adversarial Training of Denoising Diffusion Model Using Dual Discriminators for High-Fidelity Multi-Speaker TTS
Fuente:
arXiv
Salvato in:
| Autori principali: | Ko, Myeongjin, Choi, Yong-Hoon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
Score-Based Training for Energy-Based TTS Models
di: Sun, Wanli, et al.
Pubblicazione: (2025)
di: Sun, Wanli, et al.
Pubblicazione: (2025)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
Adversarial training of Keyword Spotting to Minimize TTS Data Overfitting
di: Park, Hyun Jin, et al.
Pubblicazione: (2024)
di: Park, Hyun Jin, et al.
Pubblicazione: (2024)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
di: Manku, Ruskin Raj, et al.
Pubblicazione: (2025)
di: Manku, Ruskin Raj, et al.
Pubblicazione: (2025)
RingFormer: A Neural Vocoder with Ring Attention and Convolution-Augmented Transformer
di: Hong, Seongho, et al.
Pubblicazione: (2025)
di: Hong, Seongho, et al.
Pubblicazione: (2025)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
di: Arora, Akshit, et al.
Pubblicazione: (2024)
di: Arora, Akshit, et al.
Pubblicazione: (2024)
Are Deep Speech Denoising Models Robust to Adversarial Noise?
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
Adversarial Data Augmentation for Robust Speaker Verification
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Additive Margin in Contrastive Self-Supervised Frameworks to Learn Discriminative Speaker Representations
di: Lepage, Theo, et al.
Pubblicazione: (2024)
di: Lepage, Theo, et al.
Pubblicazione: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform Generation
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
di: Zhang, Leying, et al.
Pubblicazione: (2023)
di: Zhang, Leying, et al.
Pubblicazione: (2023)
Improving the Adversarial Robustness for Speaker Verification by Self-Supervised Learning
di: Wu, Haibin, et al.
Pubblicazione: (2021)
di: Wu, Haibin, et al.
Pubblicazione: (2021)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
EM-TTS: Efficiently Trained Low-Resource Mongolian Lightweight Text-to-Speech
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
di: Gao, Chenyang, et al.
Pubblicazione: (2024)
di: Gao, Chenyang, et al.
Pubblicazione: (2024)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
di: Kim, Hyeongju, et al.
Pubblicazione: (2025)
di: Kim, Hyeongju, et al.
Pubblicazione: (2025)
LMD: A Learnable Mask Network to Detect Adversarial Examples for Speaker Verification
di: Chen, Xing, et al.
Pubblicazione: (2022)
di: Chen, Xing, et al.
Pubblicazione: (2022)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
di: Janiczek, John, et al.
Pubblicazione: (2024)
di: Janiczek, John, et al.
Pubblicazione: (2024)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
di: Yang, Jinhyeok, et al.
Pubblicazione: (2024)
di: Yang, Jinhyeok, et al.
Pubblicazione: (2024)
Compact Neural TTS Voices for Accessibility
di: Jain, Kunal, et al.
Pubblicazione: (2025)
di: Jain, Kunal, et al.
Pubblicazione: (2025)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
Multi-Stage Speaker Diarization for Noisy Classrooms
di: Khan, Ali Sartaz, et al.
Pubblicazione: (2025)
di: Khan, Ali Sartaz, et al.
Pubblicazione: (2025)
Highly Efficient Real-Time Streaming and Fully On-Device Speaker Diarization with Multi-Stage Clustering
di: Wang, Quan, et al.
Pubblicazione: (2022)
di: Wang, Quan, et al.
Pubblicazione: (2022)
Utilizing TTS Synthesized Data for Efficient Development of Keyword Spotting Model
di: Park, Hyun Jin, et al.
Pubblicazione: (2024)
di: Park, Hyun Jin, et al.
Pubblicazione: (2024)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Zero-Shot Multi-Lingual Speaker Verification in Clinical Trials
di: Akram, Ali, et al.
Pubblicazione: (2024)
di: Akram, Ali, et al.
Pubblicazione: (2024)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
Language Modelling for Speaker Diarization in Telephonic Interviews
di: India, Miquel, et al.
Pubblicazione: (2025)
di: India, Miquel, et al.
Pubblicazione: (2025)
Unsupervised Speaker Diarization in Distributed IoT Networks Using Federated Learning
di: Bhuyan, Amit Kumar, et al.
Pubblicazione: (2024)
di: Bhuyan, Amit Kumar, et al.
Pubblicazione: (2024)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching
di: Glazer, Neta, et al.
Pubblicazione: (2025)
di: Glazer, Neta, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022) -
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024) -
Score-Based Training for Energy-Based TTS Models
di: Sun, Wanli, et al.
Pubblicazione: (2025) -
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024) -
Adversarial training of Keyword Spotting to Minimize TTS Data Overfitting
di: Park, Hyun Jin, et al.
Pubblicazione: (2024)