Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion
Fuente:
arXiv
Guardado en:
| Autores principales: | Rong, Yan, Liu, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
por: Wang, Jinting, et al.
Publicado: (2025)
por: Wang, Jinting, et al.
Publicado: (2025)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
por: Kim, Ji-Hoon, et al.
Publicado: (2025)
Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
por: Kang, Minki, et al.
Publicado: (2023)
por: Kang, Minki, et al.
Publicado: (2023)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
por: Anastassiou, Philip, et al.
Publicado: (2024)
por: Anastassiou, Philip, et al.
Publicado: (2024)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
por: Kim, Taesoo, et al.
Publicado: (2025)
por: Kim, Taesoo, et al.
Publicado: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
por: Li, Haitao, et al.
Publicado: (2026)
por: Li, Haitao, et al.
Publicado: (2026)
MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers
por: Park, Kyeongman, et al.
Publicado: (2025)
por: Park, Kyeongman, et al.
Publicado: (2025)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
por: Zhao, Junchuan, et al.
Publicado: (2025)
por: Zhao, Junchuan, et al.
Publicado: (2025)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
por: Choi, Ha-Yeong, et al.
Publicado: (2025)
Hear Your Face: Face-based voice conversion with F0 estimation
por: Lee, Jaejun, et al.
Publicado: (2024)
por: Lee, Jaejun, et al.
Publicado: (2024)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023)
por: Chen, Yun, et al.
Publicado: (2023)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
por: Jang, Youngjoon, et al.
Publicado: (2024)
por: Jang, Youngjoon, et al.
Publicado: (2024)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
por: Pan, Yu, et al.
Publicado: (2024)
por: Pan, Yu, et al.
Publicado: (2024)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
VoiceCloak: A Multi-Dimensional Defense Framework against Unauthorized Diffusion-based Voice Cloning
por: Hu, Qianyue, et al.
Publicado: (2025)
por: Hu, Qianyue, et al.
Publicado: (2025)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
por: Bai, Bingsong, et al.
Publicado: (2025)
por: Bai, Bingsong, et al.
Publicado: (2025)
Emotional Face-to-Speech
por: Ye, Jiaxin, et al.
Publicado: (2025)
por: Ye, Jiaxin, et al.
Publicado: (2025)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025)
por: Kang, Fang, et al.
Publicado: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
ICASSP 2024 Speech Signal Improvement Challenge
por: Ristea, Nicolae Catalin, et al.
Publicado: (2024)
por: Ristea, Nicolae Catalin, et al.
Publicado: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
Shushing! Let's Imagine an Authentic Speech from the Silent Video
por: Ye, Jiaxin, et al.
Publicado: (2025)
por: Ye, Jiaxin, et al.
Publicado: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
por: Xu, Rixi, et al.
Publicado: (2026)
por: Xu, Rixi, et al.
Publicado: (2026)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Automated Classification of Phonetic Segments in Child Speech Using Raw Ultrasound Imaging
por: Ani, Saja Al, et al.
Publicado: (2024)
por: Ani, Saja Al, et al.
Publicado: (2024)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
CleanUMamba: A Compact Mamba Network for Speech Denoising using Channel Pruning
por: Groot, Sjoerd, et al.
Publicado: (2024)
por: Groot, Sjoerd, et al.
Publicado: (2024)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
por: Joglekar, Advait, et al.
Publicado: (2025)
por: Joglekar, Advait, et al.
Publicado: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
por: Yao, Jixun, et al.
Publicado: (2024)
por: Yao, Jixun, et al.
Publicado: (2024)
SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis
por: Qian, Jiale, et al.
Publicado: (2026)
por: Qian, Jiale, et al.
Publicado: (2026)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
Ejemplares similares
-
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
por: Wang, Jinting, et al.
Publicado: (2025) -
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
por: Kim, Ji-Hoon, et al.
Publicado: (2025) -
Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
por: Kang, Minki, et al.
Publicado: (2023) -
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
por: Anastassiou, Philip, et al.
Publicado: (2024) -
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)