Voice Conversion with Diverse Intonation using Conditional Variational Auto-Encoder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Suh, Soobin, Ahn, Dabi, Park, Heewoong, Park, Jonghun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization
par: Kim, Leekyung, et autres
Publié: (2026)
par: Kim, Leekyung, et autres
Publié: (2026)
Discrete Optimal Transport and Voice Conversion
par: Selitskiy, Anton, et autres
Publié: (2025)
par: Selitskiy, Anton, et autres
Publié: (2025)
Zero-shot Voice Conversion with Diffusion Transformers
par: Liu, Songting
Publié: (2024)
par: Liu, Songting
Publié: (2024)
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
par: Du, Zongyang, et autres
Publié: (2025)
par: Du, Zongyang, et autres
Publié: (2025)
StreamVC: Real-Time Low-Latency Voice Conversion
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
par: Lee, Philip H., et autres
Publié: (2024)
par: Lee, Philip H., et autres
Publié: (2024)
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations
par: Kim, Seungmin, et autres
Publié: (2025)
par: Kim, Seungmin, et autres
Publié: (2025)
Phoneme Hallucinator: One-shot Voice Conversion via Set Expansion
par: Shan, Siyuan, et autres
Publié: (2023)
par: Shan, Siyuan, et autres
Publié: (2023)
Does Your Voice Assistant Remember? Analyzing Conversational Context Recall and Utilization in Voice Interaction Models
par: Kim, Heeseung, et autres
Publié: (2025)
par: Kim, Heeseung, et autres
Publié: (2025)
Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation
par: Kaneko, Takuhiro, et autres
Publié: (2024)
par: Kaneko, Takuhiro, et autres
Publié: (2024)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
par: Choi, Ha-Yeong, et autres
Publié: (2025)
par: Choi, Ha-Yeong, et autres
Publié: (2025)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
par: Xie, Xurong, et autres
Publié: (2022)
par: Xie, Xurong, et autres
Publié: (2022)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
par: Melechovsky, Jan, et autres
Publié: (2022)
par: Melechovsky, Jan, et autres
Publié: (2022)
OpenVoice: Versatile Instant Voice Cloning
par: Qin, Zengyi, et autres
Publié: (2023)
par: Qin, Zengyi, et autres
Publié: (2023)
Microphone Conversion: Mitigating Device Variability in Sound Event Classification
par: Ryu, Myeonghoon, et autres
Publié: (2024)
par: Ryu, Myeonghoon, et autres
Publié: (2024)
Auto-adaptive Resonance Equalization using Dilated Residual Networks
par: Grachten, Maarten, et autres
Publié: (2018)
par: Grachten, Maarten, et autres
Publié: (2018)
Computational Extraction of Intonation and Tuning Systems from Multiple Microtonal Monophonic Vocal Recordings with Diverse Modes
par: Shafiei, Sepideh, et autres
Publié: (2025)
par: Shafiei, Sepideh, et autres
Publié: (2025)
Evaluating Echo State Network for Parkinson's Disease Prediction using Voice Features
par: Hosseininian, Seyedeh Zahra Seyedi, et autres
Publié: (2024)
par: Hosseininian, Seyedeh Zahra Seyedi, et autres
Publié: (2024)
Unified Microphone Conversion: Many-to-Many Device Mapping via Feature-wise Linear Modulation
par: Ryu, Myeonghoon, et autres
Publié: (2024)
par: Ryu, Myeonghoon, et autres
Publié: (2024)
FasterVoiceGrad: Faster One-step Diffusion-Based Voice Conversion with Adversarial Diffusion Conversion Distillation
par: Kaneko, Takuhiro, et autres
Publié: (2025)
par: Kaneko, Takuhiro, et autres
Publié: (2025)
Note-Level Singing Melody Transcription for Time-Aligned Musical Score Generation
par: Kim, Leekyung, et autres
Publié: (2025)
par: Kim, Leekyung, et autres
Publié: (2025)
The Conformer Encoder May Reverse the Time Dimension
par: Schmitt, Robin, et autres
Publié: (2024)
par: Schmitt, Robin, et autres
Publié: (2024)
VANPY: Voice Analysis Framework
par: Koushnir, Gregory, et autres
Publié: (2025)
par: Koushnir, Gregory, et autres
Publié: (2025)
MeanVoiceFlow: One-step Nonparallel Voice Conversion with Mean Flows
par: Kaneko, Takuhiro, et autres
Publié: (2026)
par: Kaneko, Takuhiro, et autres
Publié: (2026)
Do Foundational Audio Encoders Understand Music Structure?
par: Toyama, Keisuke, et autres
Publié: (2025)
par: Toyama, Keisuke, et autres
Publié: (2025)
Compact Neural TTS Voices for Accessibility
par: Jain, Kunal, et autres
Publié: (2025)
par: Jain, Kunal, et autres
Publié: (2025)
Speech to Speech Synthesis for Voice Impersonation
par: Johnson, Bjorn, et autres
Publié: (2026)
par: Johnson, Bjorn, et autres
Publié: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
par: Du, Zongyang, et autres
Publié: (2024)
par: Du, Zongyang, et autres
Publié: (2024)
Improving Generalization for AI-Synthesized Voice Detection
par: Ren, Hainan, et autres
Publié: (2024)
par: Ren, Hainan, et autres
Publié: (2024)
BiSinger: Bilingual Singing Voice Synthesis
par: Zhou, Huali, et autres
Publié: (2023)
par: Zhou, Huali, et autres
Publié: (2023)
Optimal Transport Maps are Good Voice Converters
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Hold Me Tight: Stable Encoder-Decoder Design for Speech Enhancement
par: Haider, Daniel, et autres
Publié: (2024)
par: Haider, Daniel, et autres
Publié: (2024)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
par: Zeineldeen, Mohammad, et autres
Publié: (2023)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
A Concept-based approach to Voice Disorder Detection
par: Ghia, Davide, et autres
Publié: (2025)
par: Ghia, Davide, et autres
Publié: (2025)
Tessellated Linear Model for Age Prediction from Voice
par: Alharthi, Dareen, et autres
Publié: (2025)
par: Alharthi, Dareen, et autres
Publié: (2025)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
par: Park, Sangwook, et autres
Publié: (2021)
par: Park, Sangwook, et autres
Publié: (2021)
Semantic-Aware Interpretable Multimodal Music Auto-Tagging
par: Patakis, Andreas, et autres
Publié: (2025)
par: Patakis, Andreas, et autres
Publié: (2025)
Documents similaires
-
An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization
par: Kim, Leekyung, et autres
Publié: (2026) -
Discrete Optimal Transport and Voice Conversion
par: Selitskiy, Anton, et autres
Publié: (2025) -
Zero-shot Voice Conversion with Diffusion Transformers
par: Liu, Songting
Publié: (2024) -
NaturalVoices: A Large-Scale, Spontaneous and Emotional Podcast Dataset for Voice Conversion
par: Du, Zongyang, et autres
Publié: (2025) -
StreamVC: Real-Time Low-Latency Voice Conversion
par: Yang, Yang, et autres
Publié: (2024)