Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters
Fuente:
arXiv
Guardado en:
| Autores principales: | Abrassart, Mathilde, Obin, Nicolas, Roebel, Axel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024)
por: Lemerle, Théodor, et al.
Publicado: (2024)
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024)
por: Lemerle, Théodor, et al.
Publicado: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
por: Oh, Hyung-Seok, et al.
Publicado: (2024)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
por: Choi, Joon-Seung, et al.
Publicado: (2025)
por: Choi, Joon-Seung, et al.
Publicado: (2025)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
por: Yoon, Jinsung, et al.
Publicado: (2025)
por: Yoon, Jinsung, et al.
Publicado: (2025)
Application of ASV for Voice Identification after VC and Duration Predictor Improvement in TTS Models
por: Nikolayevich, Borodin Kirill, et al.
Publicado: (2024)
por: Nikolayevich, Borodin Kirill, et al.
Publicado: (2024)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
A Real-Time Voice Activity Detection Based On Lightweight Neural
por: Jia, Jidong, et al.
Publicado: (2024)
por: Jia, Jidong, et al.
Publicado: (2024)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
por: Huang, Jiawei, et al.
Publicado: (2024)
por: Huang, Jiawei, et al.
Publicado: (2024)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
por: Bai, Bingsong, et al.
Publicado: (2024)
por: Bai, Bingsong, et al.
Publicado: (2024)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
por: Neekhara, Paarth, et al.
Publicado: (2023)
por: Neekhara, Paarth, et al.
Publicado: (2023)
Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023)
por: Chen, Yun, et al.
Publicado: (2023)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
por: Kaneko, Takuhiro, et al.
Publicado: (2024)
por: Kaneko, Takuhiro, et al.
Publicado: (2024)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
por: Zhao, Junchuan, et al.
Publicado: (2025)
por: Zhao, Junchuan, et al.
Publicado: (2025)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
por: Chinchmalatpure, Prajwal, et al.
Publicado: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
Parameter Selection for Analyzing Conversations with Autism Spectrum Disorder
por: Chowdhury, Tahiya, et al.
Publicado: (2024)
por: Chowdhury, Tahiya, et al.
Publicado: (2024)
CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data
por: Bai, Qibing, et al.
Publicado: (2026)
por: Bai, Qibing, et al.
Publicado: (2026)
PitchFlower: A flow-based neural audio codec with pitch controllability
por: Torres, Diego, et al.
Publicado: (2025)
por: Torres, Diego, et al.
Publicado: (2025)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
A New Approach to Voice Authenticity
por: Müller, Nicolas M., et al.
Publicado: (2024)
por: Müller, Nicolas M., et al.
Publicado: (2024)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
por: Rouard, Simon, et al.
Publicado: (2025)
por: Rouard, Simon, et al.
Publicado: (2025)
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
por: Dhar, Sandipan, et al.
Publicado: (2025)
por: Dhar, Sandipan, et al.
Publicado: (2025)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Adaptive Duration Model for Text Speech Alignment
por: Cao, Junjie
Publicado: (2025)
por: Cao, Junjie
Publicado: (2025)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners
por: Tsai, Fang-Duo, et al.
Publicado: (2025)
por: Tsai, Fang-Duo, et al.
Publicado: (2025)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
por: Ryu, Yerin, et al.
Publicado: (2025)
por: Ryu, Yerin, et al.
Publicado: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
Ejemplares similares
-
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024) -
Small-E: Small Language Model with Linear Attention for Efficient Speech Synthesis
por: Lemerle, Théodor, et al.
Publicado: (2024) -
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
por: Huang, Yubo, et al.
Publicado: (2024) -
DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment
por: Oh, Hyung-Seok, et al.
Publicado: (2024) -
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
por: Choi, Joon-Seung, et al.
Publicado: (2025)