Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Avdeeva, Anastasia, Gusev, Aleksei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
di: Joglekar, Advait, et al.
Pubblicazione: (2025)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
di: Tu, Huu Tuong, et al.
Pubblicazione: (2025)
di: Tu, Huu Tuong, et al.
Pubblicazione: (2025)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
di: Zhang, Leying, et al.
Pubblicazione: (2026)
di: Zhang, Leying, et al.
Pubblicazione: (2026)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2023)
di: Wang, Zhichao, et al.
Pubblicazione: (2023)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
di: Li, Xuyuan, et al.
Pubblicazione: (2024)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
di: Li, Junjie, et al.
Pubblicazione: (2023)
di: Li, Junjie, et al.
Pubblicazione: (2023)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
di: Kang, Wonjune, et al.
Pubblicazione: (2022)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Improving Rare-Word Recognition of Whisper in Zero-Shot Settings
di: Jogi, Yash, et al.
Pubblicazione: (2025)
di: Jogi, Yash, et al.
Pubblicazione: (2025)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
di: Zhang, Li, et al.
Pubblicazione: (2024)
di: Zhang, Li, et al.
Pubblicazione: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
Erasing Your Voice Before It's Heard: Training-free Speaker Unlearning for Zero-shot Text-to-Speech
di: Lee, Myungjin, et al.
Pubblicazione: (2026)
di: Lee, Myungjin, et al.
Pubblicazione: (2026)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
di: Chen, Meiying, et al.
Pubblicazione: (2022)
di: Chen, Meiying, et al.
Pubblicazione: (2022)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
di: Biyani, Ishan D., et al.
Pubblicazione: (2025)
WhispEar: A Bi-directional Framework for Scaling Whispered Speech Conversion via Pseudo-Parallel Whisper Generation
di: Fang, Zihao, et al.
Pubblicazione: (2026)
di: Fang, Zihao, et al.
Pubblicazione: (2026)
Whisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models
di: Zhao, Yiyang, et al.
Pubblicazione: (2024)
di: Zhao, Yiyang, et al.
Pubblicazione: (2024)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
di: Meng, Ming, et al.
Pubblicazione: (2025)
di: Meng, Ming, et al.
Pubblicazione: (2025)
FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2026)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2026)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
di: Yu, Fan, et al.
Pubblicazione: (2025)
di: Yu, Fan, et al.
Pubblicazione: (2025)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024) -
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
di: Joglekar, Advait, et al.
Pubblicazione: (2025) -
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
di: Tu, Huu Tuong, et al.
Pubblicazione: (2025) -
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
di: Zhang, Leying, et al.
Pubblicazione: (2026) -
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)