Salvato in:
| Autori principali: | Akti, Seymanur, Nguyen, Tuan Nam, Waibel, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.04013 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
di: Sim, Youngjun, et al.
Pubblicazione: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
di: Zheng, Junjie, et al.
Pubblicazione: (2025)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
di: Choi, Ha-Yeong, et al.
Pubblicazione: (2025)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis
di: Qian, Jiale, et al.
Pubblicazione: (2026)
di: Qian, Jiale, et al.
Pubblicazione: (2026)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
di: Bak, Taejun, et al.
Pubblicazione: (2024)
di: Bak, Taejun, et al.
Pubblicazione: (2024)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
di: Chen, Yun, et al.
Pubblicazione: (2023)
di: Chen, Yun, et al.
Pubblicazione: (2023)
CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
di: Zhang, Leying, et al.
Pubblicazione: (2025)
di: Zhang, Leying, et al.
Pubblicazione: (2025)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
di: Anastassiou, Philip, et al.
Pubblicazione: (2024)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
di: Kim, Nam-Gyu, et al.
Pubblicazione: (2025)
di: Kim, Nam-Gyu, et al.
Pubblicazione: (2025)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026)
di: Xu, Rixi, et al.
Pubblicazione: (2026)
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
di: Seo, Deokjin, et al.
Pubblicazione: (2026)
di: Seo, Deokjin, et al.
Pubblicazione: (2026)
Accent conversion using discrete units with parallel data synthesized from controllable accented TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
CloneShield: A Framework for Universal Perturbation Against Zero-Shot Voice Cloning
di: Li, Renyuan, et al.
Pubblicazione: (2025)
di: Li, Renyuan, et al.
Pubblicazione: (2025)
MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers
di: Park, Kyeongman, et al.
Pubblicazione: (2025)
di: Park, Kyeongman, et al.
Pubblicazione: (2025)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
di: Rong, Yan, et al.
Pubblicazione: (2024)
di: Rong, Yan, et al.
Pubblicazione: (2024)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
di: Zhang, Leying, et al.
Pubblicazione: (2026)
di: Zhang, Leying, et al.
Pubblicazione: (2026)
Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement
di: Chen, Qianniu, et al.
Pubblicazione: (2025)
di: Chen, Qianniu, et al.
Pubblicazione: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
di: wu, Weihao, et al.
Pubblicazione: (2025)
di: wu, Weihao, et al.
Pubblicazione: (2025)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents
di: Li, Haiyun, et al.
Pubblicazione: (2025)
di: Li, Haiyun, et al.
Pubblicazione: (2025)
Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition
di: Guo, Chengling, et al.
Pubblicazione: (2026)
di: Guo, Chengling, et al.
Pubblicazione: (2026)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
di: Huang, Jiawei, et al.
Pubblicazione: (2024)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization
di: Shao, Keren, et al.
Pubblicazione: (2025)
di: Shao, Keren, et al.
Pubblicazione: (2025)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
di: Bai, Bingsong, et al.
Pubblicazione: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
di: Huang, Yubo, et al.
Pubblicazione: (2024)
di: Huang, Yubo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024) -
Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement
di: Nguyen, Tuan-Nam, et al.
Pubblicazione: (2025) -
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
di: Sim, Youngjun, et al.
Pubblicazione: (2024) -
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
di: Wang, Kaidi, et al.
Pubblicazione: (2025) -
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
di: Yang, Yuguang, et al.
Pubblicazione: (2024)