VCTR: A Transformer-Based Model for Non-parallel Voice Conversion
Fuente:
arXiv
Salvato in:
| Autore principale: | Saikia, Maharnab |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
di: Yao, Wenhan, et al.
Pubblicazione: (2024)
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
di: Seki, Kentaro, et al.
Pubblicazione: (2024)
di: Seki, Kentaro, et al.
Pubblicazione: (2024)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)
Zero-shot Voice Conversion with Diffusion Transformers
di: Liu, Songting
Pubblicazione: (2024)
di: Liu, Songting
Pubblicazione: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling
di: Geng, Chen, et al.
Pubblicazione: (2026)
di: Geng, Chen, et al.
Pubblicazione: (2026)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
di: Wang, Zhichao, et al.
Pubblicazione: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
di: Du, Zongyang, et al.
Pubblicazione: (2024)
di: Du, Zongyang, et al.
Pubblicazione: (2024)
AVENet: Disentangling Features by Approximating Average Features for Voice Conversion
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
di: Neekhara, Paarth, et al.
Pubblicazione: (2023)
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2023)
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2023)
Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
di: Kim, Heeseung, et al.
Pubblicazione: (2025)
di: Kim, Heeseung, et al.
Pubblicazione: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
di: Akti, Seymanur, et al.
Pubblicazione: (2025)
Generating Novel and Realistic Speakers for Voice Conversion
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
di: Chen, Meiying Melissa, et al.
Pubblicazione: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
di: Byun, Kyungguen, et al.
Pubblicazione: (2025)
Multichannel Voice Trigger Detection Based on Transform-average-concatenate
di: Higuchi, Takuya, et al.
Pubblicazione: (2023)
di: Higuchi, Takuya, et al.
Pubblicazione: (2023)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
Self Voice Conversion as an Attack against Neural Audio Watermarking
di: Özer, Yigitcan, et al.
Pubblicazione: (2026)
di: Özer, Yigitcan, et al.
Pubblicazione: (2026)
Discrete Optimal Transport and Voice Conversion
di: Selitskiy, Anton, et al.
Pubblicazione: (2025)
di: Selitskiy, Anton, et al.
Pubblicazione: (2025)
SingIt! Singer Voice Transformation
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2024)
Text-Driven Voice Conversion via Latent State-Space Modeling
di: Li, Wen, et al.
Pubblicazione: (2025)
di: Li, Wen, et al.
Pubblicazione: (2025)
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
di: Du, Zongyang, et al.
Pubblicazione: (2025)
di: Du, Zongyang, et al.
Pubblicazione: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
di: Xu, Le, et al.
Pubblicazione: (2023)
di: Xu, Le, et al.
Pubblicazione: (2023)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
di: Li, Yuke, et al.
Pubblicazione: (2024)
di: Li, Yuke, et al.
Pubblicazione: (2024)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
di: Wang, Wenyu, et al.
Pubblicazione: (2025)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
di: Liu, Yisi, et al.
Pubblicazione: (2026)
di: Liu, Yisi, et al.
Pubblicazione: (2026)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
di: Huang, Yubo, et al.
Pubblicazione: (2024)
di: Huang, Yubo, et al.
Pubblicazione: (2024)
Voice Conversion-based Privacy through Adversarial Information Hiding
di: Webber, Jacob J, et al.
Pubblicazione: (2024)
di: Webber, Jacob J, et al.
Pubblicazione: (2024)
RAVE for Speech: Efficient Voice Conversion at High Sampling Rates
di: Bargum, Anders R., et al.
Pubblicazione: (2024)
di: Bargum, Anders R., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2025) -
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
di: Yao, Wenhan, et al.
Pubblicazione: (2024) -
Collective Learning Mechanism based Optimal Transport Generative Adversarial Network for Non-parallel Voice Conversion
di: Dhar, Sandipan, et al.
Pubblicazione: (2025) -
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
di: Seki, Kentaro, et al.
Pubblicazione: (2024) -
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2020)