FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Kaneko, Takuhiro, Kameoka, Hirokazu, Tanaka, Kou, Kondo, Yuto |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
MeanVoiceFlow: One-step Nonparallel Voice Conversion with Mean Flows
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2026)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2026)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
Selecting N-lowest scores for training MOS prediction models
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024)
di: Du, Zongyang, et al.
Pubblicazione: (2024)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
Voice Conversion-based Privacy through Adversarial Information Hiding
di: Webber, Jacob J, et al.
Pubblicazione: (2024)
di: Webber, Jacob J, et al.
Pubblicazione: (2024)
Zero-shot Voice Conversion with Diffusion Transformers
di: Liu, Songting
Pubblicazione: (2024)
di: Liu, Songting
Pubblicazione: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis
di: Sui, Kehan, et al.
Pubblicazione: (2024)
di: Sui, Kehan, et al.
Pubblicazione: (2024)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
di: Abrassart, Mathilde, et al.
Pubblicazione: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
di: Seki, Kentaro, et al.
Pubblicazione: (2024)
di: Seki, Kentaro, et al.
Pubblicazione: (2024)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
di: Li, Yuke, et al.
Pubblicazione: (2024)
di: Li, Yuke, et al.
Pubblicazione: (2024)
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
FlashSR: One-step Versatile Audio Super-resolution via Diffusion Distillation
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
di: Du, Zongcai, et al.
Pubblicazione: (2025)
di: Du, Zongcai, et al.
Pubblicazione: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
di: Watanabe, Chihiro, et al.
Pubblicazione: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
di: Cao, Songjun, et al.
Pubblicazione: (2025)
di: Cao, Songjun, et al.
Pubblicazione: (2025)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
di: Yu, Fan, et al.
Pubblicazione: (2025)
di: Yu, Fan, et al.
Pubblicazione: (2025)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
di: Wang, Rui, et al.
Pubblicazione: (2024)
di: Wang, Rui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025) -
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025) -
MeanVoiceFlow: One-step Nonparallel Voice Conversion with Mean Flows
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2026) -
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020) -
Rethinking Mean Opinion Scores in Speech Quality Assessment: Aggregation through Quantized Distribution Fitting
di: Kondo, Yuto, et al.
Pubblicazione: (2025)