Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xueyao, Zhang, Xiaohui, Peng, Kainan, Tang, Zhenyu, Manohar, Vimal, Liu, Yingru, Hwang, Jeff, Li, Dangna, Wang, Yuhao, Chan, Julian, Huang, Yuan, Wu, Zhizheng, Ma, Mingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025)
par: Mehta, Shivam, et autres
Publié: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
ZSDEVC: Zero-Shot Diffusion-based Emotional Voice Conversion with Disentangled Mechanism
par: Chou, Hsing-Hang, et autres
Publié: (2024)
par: Chou, Hsing-Hang, et autres
Publié: (2024)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
Debatts: Zero-Shot Debating Text-to-Speech Synthesis
par: Huang, Yiqiao, et autres
Publié: (2024)
par: Huang, Yiqiao, et autres
Publié: (2024)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
par: Xue, Liumeng, et autres
Publié: (2024)
par: Xue, Liumeng, et autres
Publié: (2024)
GenVC: Self-Supervised Zero-Shot Voice Conversion
par: Cai, Zexin, et autres
Publié: (2025)
par: Cai, Zexin, et autres
Publié: (2025)
Audio Deepfake Verification
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
par: Wang, Yuancheng, et autres
Publié: (2024)
par: Wang, Yuancheng, et autres
Publié: (2024)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
par: Akti, Seymanur, et autres
Publié: (2025)
par: Akti, Seymanur, et autres
Publié: (2025)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
par: Li, Xuyuan, et autres
Publié: (2024)
par: Li, Xuyuan, et autres
Publié: (2024)
Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs
par: Hsu, Ming-Hao, et autres
Publié: (2026)
par: Hsu, Ming-Hao, et autres
Publié: (2026)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
par: Sim, Youngjun, et autres
Publié: (2024)
par: Sim, Youngjun, et autres
Publié: (2024)
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
par: Li, Ruiqi, et autres
Publié: (2026)
par: Li, Ruiqi, et autres
Publié: (2026)
Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
par: Wang, Kaidi, et autres
Publié: (2025)
par: Wang, Kaidi, et autres
Publié: (2025)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
par: Gu, Yicheng, et autres
Publié: (2024)
par: Gu, Yicheng, et autres
Publié: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
Zero-Shot Duet Singing Voices Separation with Diffusion Models
par: Yu, Chin-Yun, et autres
Publié: (2023)
par: Yu, Chin-Yun, et autres
Publié: (2023)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
par: Jiang, Shaohan, et autres
Publié: (2025)
par: Jiang, Shaohan, et autres
Publié: (2025)
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
par: Jiang, Yuepeng, et autres
Publié: (2025)
par: Jiang, Yuepeng, et autres
Publié: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
par: Kang, Wonjune, et autres
Publié: (2022)
par: Kang, Wonjune, et autres
Publié: (2022)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
Acoustic modeling for Overlapping Speech Recognition: JHU Chime-5 Challenge System
par: Manohar, Vimal, et autres
Publié: (2024)
par: Manohar, Vimal, et autres
Publié: (2024)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
par: Peng, Puyuan, et autres
Publié: (2025)
par: Peng, Puyuan, et autres
Publié: (2025)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
par: Chen, Meiying, et autres
Publié: (2022)
par: Chen, Meiying, et autres
Publié: (2022)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
Documents similaires
-
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024) -
SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment
par: Mehta, Shivam, et autres
Publié: (2025) -
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025) -
ZSDEVC: Zero-Shot Diffusion-based Emotional Voice Conversion with Disentangled Mechanism
par: Chou, Hsing-Hang, et autres
Publié: (2024) -
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
par: Zhang, Xueyao, et autres
Publié: (2025)