Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements
Fuente:
arXiv
Guardado en:
| Autores principales: | Dhar, Sandipan, Jana, Nanda Dulal, Das, Swagatam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023)
por: Chen, Yun, et al.
Publicado: (2023)
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
por: Kaneko, Takuhiro, et al.
Publicado: (2025)
por: Kaneko, Takuhiro, et al.
Publicado: (2025)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
por: Wang, Rui, et al.
Publicado: (2024)
por: Wang, Rui, et al.
Publicado: (2024)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
por: Huang, Jiawei, et al.
Publicado: (2024)
por: Huang, Jiawei, et al.
Publicado: (2024)
RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis
por: Sui, Kehan, et al.
Publicado: (2024)
por: Sui, Kehan, et al.
Publicado: (2024)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
por: Bai, Bingsong, et al.
Publicado: (2024)
por: Bai, Bingsong, et al.
Publicado: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
por: Neekhara, Paarth, et al.
Publicado: (2023)
por: Neekhara, Paarth, et al.
Publicado: (2023)
FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
por: Kaneko, Takuhiro, et al.
Publicado: (2024)
por: Kaneko, Takuhiro, et al.
Publicado: (2024)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
The Voice Timbre Attribute Detection 2025 Challenge Evaluation Plan
por: Sheng, Zhengyan, et al.
Publicado: (2025)
por: Sheng, Zhengyan, et al.
Publicado: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
por: Abrassart, Mathilde, et al.
Publicado: (2025)
por: Abrassart, Mathilde, et al.
Publicado: (2025)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
por: Zhao, Junchuan, et al.
Publicado: (2025)
por: Zhao, Junchuan, et al.
Publicado: (2025)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Speech Bandwidth Expansion Via High Fidelity Generative Adversarial Networks
por: Salhab, Mahmoud, et al.
Publicado: (2024)
por: Salhab, Mahmoud, et al.
Publicado: (2024)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
por: Choi, Joon-Seung, et al.
Publicado: (2025)
por: Choi, Joon-Seung, et al.
Publicado: (2025)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Voice Conversion-based Privacy through Adversarial Information Hiding
por: Webber, Jacob J, et al.
Publicado: (2024)
por: Webber, Jacob J, et al.
Publicado: (2024)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025)
por: Wen, Bin, et al.
Publicado: (2025)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
por: Guragain, Anmol, et al.
Publicado: (2024)
por: Guragain, Anmol, et al.
Publicado: (2024)
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
por: Ghosh, Suhita, et al.
Publicado: (2024)
por: Ghosh, Suhita, et al.
Publicado: (2024)
Contrastive Learning-based Chaining-Cluster for Multilingual Voice-Face Association
por: Chen, Wuyang, et al.
Publicado: (2024)
por: Chen, Wuyang, et al.
Publicado: (2024)
CoMoSVC: Consistency Model-based Singing Voice Conversion
por: Lu, Yiwen, et al.
Publicado: (2024)
por: Lu, Yiwen, et al.
Publicado: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Ejemplares similares
-
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
por: Dhar, Sandipan, et al.
Publicado: (2025) -
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
por: Dhar, Sandipan, et al.
Publicado: (2025) -
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023) -
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
por: Kaneko, Takuhiro, et al.
Publicado: (2025) -
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
por: Wang, Rui, et al.
Publicado: (2024)