StreamVC: Real-Time Low-Latency Voice Conversion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yang, Kartynnik, Yury, Li, Yunpeng, Tang, Jiuqiang, Li, Xing, Sung, George, Grundmann, Matthias |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
par: Guo, Zhao, et autres
Publié: (2025)
par: Guo, Zhao, et autres
Publié: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024)
par: Li, Yuke, et autres
Publié: (2024)
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
par: Cao, Songjun, et autres
Publié: (2025)
par: Cao, Songjun, et autres
Publié: (2025)
ControlVC: Zero-Shot Voice Conversion with Time-Varying Controls on Pitch and Speed
par: Chen, Meiying, et autres
Publié: (2022)
par: Chen, Meiying, et autres
Publié: (2022)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
par: Byun, Kyungguen, et autres
Publié: (2024)
par: Byun, Kyungguen, et autres
Publié: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
par: Saito, Yuki, et autres
Publié: (2024)
par: Saito, Yuki, et autres
Publié: (2024)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2024)
par: Wang, Zhichao, et autres
Publié: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
par: Ren, Pengyu, et autres
Publié: (2025)
par: Ren, Pengyu, et autres
Publié: (2025)
Delayed-KD: Delayed Knowledge Distillation based CTC for Low-Latency Streaming ASR
par: Li, Longhao, et autres
Publié: (2025)
par: Li, Longhao, et autres
Publié: (2025)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
par: Niu, Xinlei, et autres
Publié: (2024)
par: Niu, Xinlei, et autres
Publié: (2024)
Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training
par: Yao, Wenhan, et autres
Publié: (2025)
par: Yao, Wenhan, et autres
Publié: (2025)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
par: Tu, Huu Tuong, et autres
Publié: (2025)
par: Tu, Huu Tuong, et autres
Publié: (2025)
Binaural Angular Separation Network
par: Yang, Yang, et autres
Publié: (2024)
par: Yang, Yang, et autres
Publié: (2024)
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
par: Li, Na, et autres
Publié: (2025)
par: Li, Na, et autres
Publié: (2025)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
par: Liang, Ziqi, et autres
Publié: (2024)
par: Liang, Ziqi, et autres
Publié: (2024)
SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention
par: Li, Junjie, et autres
Publié: (2023)
par: Li, Junjie, et autres
Publié: (2023)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
par: Kim, Jaehun, et autres
Publié: (2025)
par: Kim, Jaehun, et autres
Publié: (2025)
MulliVC: Multi-lingual Voice Conversion With Cycle Consistency
par: Huang, Jiawei, et autres
Publié: (2024)
par: Huang, Jiawei, et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy
par: Ma, Linhan, et autres
Publié: (2024)
par: Ma, Linhan, et autres
Publié: (2024)
EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion
par: Joglekar, Advait, et autres
Publié: (2025)
par: Joglekar, Advait, et autres
Publié: (2025)
SelfVC: Voice Conversion With Iterative Refinement using Self Transformations
par: Neekhara, Paarth, et autres
Publié: (2023)
par: Neekhara, Paarth, et autres
Publié: (2023)
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
par: Wang, Chengyou, et autres
Publié: (2026)
par: Wang, Chengyou, et autres
Publié: (2026)
Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training
par: Yao, Wenhan, et autres
Publié: (2024)
par: Yao, Wenhan, et autres
Publié: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
par: Wang, Kaidi, et autres
Publié: (2025)
par: Wang, Kaidi, et autres
Publié: (2025)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
par: He, Shulin, et autres
Publié: (2023)
par: He, Shulin, et autres
Publié: (2023)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
par: Morrone, Giovanni, et autres
Publié: (2023)
par: Morrone, Giovanni, et autres
Publié: (2023)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
par: Wang, Zhichao, et autres
Publié: (2026)
par: Wang, Zhichao, et autres
Publié: (2026)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
par: Yoneyama, Reo, et autres
Publié: (2025)
par: Yoneyama, Reo, et autres
Publié: (2025)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
par: Sim, Youngjun, et autres
Publié: (2024)
par: Sim, Youngjun, et autres
Publié: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
par: Zuo, Jialong, et autres
Publié: (2025)
par: Zuo, Jialong, et autres
Publié: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
par: Yang, Yuguang, et autres
Publié: (2024)
par: Yang, Yuguang, et autres
Publié: (2024)
LL-SDR: Low-Latency Speech enhancement through Discrete Representations
par: Li, Jingyi, et autres
Publié: (2026)
par: Li, Jingyi, et autres
Publié: (2026)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
par: Chen, Meiying Melissa, et autres
Publié: (2025)
par: Chen, Meiying Melissa, et autres
Publié: (2025)
Documents similaires
-
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
par: Guo, Zhao, et autres
Publié: (2025) -
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023) -
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025) -
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024) -
PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data
par: Cao, Songjun, et autres
Publié: (2025)