AVENet: Disentangling Features by Approximating Average Features for Voice Conversion
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Wenyu, Zhou, Yiquan, Zhu, Jihua, Ding, Hongwu, Xu, Jiacheng, Li, Shihao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
por: Zhou, Yiquan, et al.
Publicado: (2025)
por: Zhou, Yiquan, et al.
Publicado: (2025)
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
por: Wang, Wenyu, et al.
Publicado: (2025)
por: Wang, Wenyu, et al.
Publicado: (2025)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
por: Jiang, Han, et al.
Publicado: (2024)
por: Jiang, Han, et al.
Publicado: (2024)
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
por: Hu, Zhetao, et al.
Publicado: (2026)
por: Hu, Zhetao, et al.
Publicado: (2026)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Voice Conversion for Lombard Speaking Style with Implicit and Explicit Acoustic Feature Conditioning
por: Woszczyk, Dominika, et al.
Publicado: (2025)
por: Woszczyk, Dominika, et al.
Publicado: (2025)
Discrete Unit based Masking for Improving Disentanglement in Voice Conversion
por: Lee, Philip H., et al.
Publicado: (2024)
por: Lee, Philip H., et al.
Publicado: (2024)
Disentangling Hierarchical Features for Anomalous Sound Detection Under Domain Shift
por: Guan, Jian, et al.
Publicado: (2025)
por: Guan, Jian, et al.
Publicado: (2025)
SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
Stepback: Enhanced Disentanglement for Voice Conversion via Multi-Task Learning
por: Yang, Qian, et al.
Publicado: (2025)
por: Yang, Qian, et al.
Publicado: (2025)
Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
por: Zhang, Yanzhe, et al.
Publicado: (2024)
por: Zhang, Yanzhe, et al.
Publicado: (2024)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
por: Wang, Kaidi, et al.
Publicado: (2025)
por: Wang, Kaidi, et al.
Publicado: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion
por: Akti, Seymanur, et al.
Publicado: (2025)
por: Akti, Seymanur, et al.
Publicado: (2025)
Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion
por: Chen, Yun, et al.
Publicado: (2023)
por: Chen, Yun, et al.
Publicado: (2023)
Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling
por: Geng, Chen, et al.
Publicado: (2026)
por: Geng, Chen, et al.
Publicado: (2026)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
por: Li, Pengcheng, et al.
Publicado: (2024)
por: Li, Pengcheng, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion
por: Sim, Youngjun, et al.
Publicado: (2024)
por: Sim, Youngjun, et al.
Publicado: (2024)
AuthGlass: Benchmarking Voice Liveness Detection and Authentication on Smart Glasses via Comprehensive Acoustic Features
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
por: Huang, Yubo, et al.
Publicado: (2024)
por: Huang, Yubo, et al.
Publicado: (2024)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
por: Seki, Kentaro, et al.
Publicado: (2024)
por: Seki, Kentaro, et al.
Publicado: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Converting Anyone's Voice: End-to-End Expressive Voice Conversion with a Conditional Diffusion Model
por: Du, Zongyang, et al.
Publicado: (2024)
por: Du, Zongyang, et al.
Publicado: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
por: Shen, Lipeng, et al.
Publicado: (2024)
por: Shen, Lipeng, et al.
Publicado: (2024)
VCTR: A Transformer-Based Model for Non-parallel Voice Conversion
por: Saikia, Maharnab
Publicado: (2025)
por: Saikia, Maharnab
Publicado: (2025)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Self Voice Conversion as an Attack against Neural Audio Watermarking
por: Özer, Yigitcan, et al.
Publicado: (2026)
por: Özer, Yigitcan, et al.
Publicado: (2026)
Disentangling Textual and Acoustic Features of Neural Speech Representations
por: Mohebbi, Hosein, et al.
Publicado: (2024)
por: Mohebbi, Hosein, et al.
Publicado: (2024)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
por: Meng, Ming, et al.
Publicado: (2025)
por: Meng, Ming, et al.
Publicado: (2025)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
por: Yu, Fan, et al.
Publicado: (2025)
por: Yu, Fan, et al.
Publicado: (2025)
Ejemplares similares
-
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
por: Zhou, Yiquan, et al.
Publicado: (2025) -
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
por: Wang, Wenyu, et al.
Publicado: (2025) -
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
por: Jiang, Han, et al.
Publicado: (2024) -
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
por: Hu, Zhetao, et al.
Publicado: (2026) -
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
por: Zhu, Xinfa, et al.
Publicado: (2025)