Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Linhan, Zhu, Xinfa, Lv, Yuanjun, Wang, Zhichao, Wang, Ziqian, He, Wendi, Zhou, Hongbin, Xie, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
por: Li, Yuke, et al.
Publicado: (2024)
por: Li, Yuke, et al.
Publicado: (2024)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024)
por: Yao, Jixun, et al.
Publicado: (2024)
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
por: Ning, Ziqian, et al.
Publicado: (2024)
por: Ning, Ziqian, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
por: Jiang, Yuepeng, et al.
Publicado: (2025)
por: Jiang, Yuepeng, et al.
Publicado: (2025)
X-VC: Zero-shot Streaming Voice Conversion in Codec Space
por: Zheng, Qixi, et al.
Publicado: (2026)
por: Zheng, Qixi, et al.
Publicado: (2026)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
por: Ning, Ziqian, et al.
Publicado: (2023)
por: Ning, Ziqian, et al.
Publicado: (2023)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
por: Ma, Guobin, et al.
Publicado: (2025)
por: Ma, Guobin, et al.
Publicado: (2025)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
por: Guo, Zhao, et al.
Publicado: (2025)
por: Guo, Zhao, et al.
Publicado: (2025)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
por: Cao, Songjun, et al.
Publicado: (2025)
por: Cao, Songjun, et al.
Publicado: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
GenVC: Self-Supervised Zero-Shot Voice Conversion
por: Cai, Zexin, et al.
Publicado: (2025)
por: Cai, Zexin, et al.
Publicado: (2025)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
por: Liu, Yisi, et al.
Publicado: (2025)
por: Liu, Yisi, et al.
Publicado: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
por: Chen, Meiying, et al.
Publicado: (2022)
por: Chen, Meiying, et al.
Publicado: (2022)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
Accent-VITS:accent transfer for end-to-end TTS
por: Ma, Linhan, et al.
Publicado: (2023)
por: Ma, Linhan, et al.
Publicado: (2023)
Zero-shot Voice Conversion with Diffusion Transformers
por: Liu, Songting
Publicado: (2024)
por: Liu, Songting
Publicado: (2024)
FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
Real-Time and Accurate: Zero-shot High-Fidelity Singing Voice Conversion with Multi-Condition Flow Synthesis
por: Li, Hui, et al.
Publicado: (2024)
por: Li, Hui, et al.
Publicado: (2024)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Zero-shot Cross-lingual Voice Transfer for TTS
por: Biadsy, Fadi, et al.
Publicado: (2024)
por: Biadsy, Fadi, et al.
Publicado: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
por: Li, Junjie, et al.
Publicado: (2023)
por: Li, Junjie, et al.
Publicado: (2023)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
por: Byun, Kyungguen, et al.
Publicado: (2024)
por: Byun, Kyungguen, et al.
Publicado: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
por: Saito, Yuki, et al.
Publicado: (2024)
por: Saito, Yuki, et al.
Publicado: (2024)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
por: Li, Pengcheng, et al.
Publicado: (2024)
por: Li, Pengcheng, et al.
Publicado: (2024)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion
por: Wang, Ziqian, et al.
Publicado: (2026)
por: Wang, Ziqian, et al.
Publicado: (2026)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
DreamVoice: Text-Guided Voice Conversion
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
por: Kim, Jaehun, et al.
Publicado: (2025)
por: Kim, Jaehun, et al.
Publicado: (2025)
Ejemplares similares
-
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
por: Li, Yuke, et al.
Publicado: (2024) -
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024) -
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
por: Ning, Ziqian, et al.
Publicado: (2024) -
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024) -
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
por: Jiang, Yuepeng, et al.
Publicado: (2025)