SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Junjie, Guo, Yiwei, Chen, Xie, Yu, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization
di: Tang, Beilong, et al.
Pubblicazione: (2025)
di: Tang, Beilong, et al.
Pubblicazione: (2025)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)
di: Chen, Meiying, et al.
Pubblicazione: (2022)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
di: Li, Yuke, et al.
Pubblicazione: (2024)
di: Li, Yuke, et al.
Pubblicazione: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2023)
di: Wang, Zhichao, et al.
Pubblicazione: (2023)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
di: Avdeeva, Anastasia, et al.
Pubblicazione: (2024)
di: Avdeeva, Anastasia, et al.
Pubblicazione: (2024)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
di: Guo, Zhao, et al.
Pubblicazione: (2025)
di: Guo, Zhao, et al.
Pubblicazione: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
di: Liu, Sen, et al.
Pubblicazione: (2024)
di: Liu, Sen, et al.
Pubblicazione: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
di: Cao, Songjun, et al.
Pubblicazione: (2025)
di: Cao, Songjun, et al.
Pubblicazione: (2025)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy
di: Ma, Linhan, et al.
Pubblicazione: (2024)
di: Ma, Linhan, et al.
Pubblicazione: (2024)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
di: Byun, Kyungguen, et al.
Pubblicazione: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
di: Saito, Yuki, et al.
Pubblicazione: (2024)
di: Saito, Yuki, et al.
Pubblicazione: (2024)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026)
di: Xu, Rixi, et al.
Pubblicazione: (2026)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
di: Lehečka, Jan, et al.
Pubblicazione: (2024)
di: Lehečka, Jan, et al.
Pubblicazione: (2024)
FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion
di: Ferreira, Alef Iury Siqueira, et al.
Pubblicazione: (2025)
di: Ferreira, Alef Iury Siqueira, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024) -
SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization
di: Tang, Beilong, et al.
Pubblicazione: (2025) -
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025) -
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025) -
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)