SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zihao, Ma, Le, Feng, Yongsheng, Pan, Xin, Jin, Yuhang, Zhang, Kejun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music
por: Wang, Zihao, et al.
Publicado: (2024)
por: Wang, Zihao, et al.
Publicado: (2024)
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
por: Zheng, Zihao, et al.
Publicado: (2026)
por: Zheng, Zihao, et al.
Publicado: (2026)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
por: Zheng, Zihao, et al.
Publicado: (2025)
por: Zheng, Zihao, et al.
Publicado: (2025)
STAR: Speech-to-Audio Generation via Representation Learning
por: Xie, Zeyu, et al.
Publicado: (2025)
por: Xie, Zeyu, et al.
Publicado: (2025)
FakeSound2: A Benchmark for Explainable and Generalizable Deepfake Sound Detection
por: Xie, Zeyu, et al.
Publicado: (2025)
por: Xie, Zeyu, et al.
Publicado: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
FakeSound: Deepfake General Audio Detection
por: Xie, Zeyu, et al.
Publicado: (2024)
por: Xie, Zeyu, et al.
Publicado: (2024)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
por: Cheripally, Sowmya
Publicado: (2024)
por: Cheripally, Sowmya
Publicado: (2024)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
por: Deng, Jiajun, et al.
Publicado: (2025)
por: Deng, Jiajun, et al.
Publicado: (2025)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
por: Gu, Ke, et al.
Publicado: (2025)
por: Gu, Ke, et al.
Publicado: (2025)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
por: Phukan, Orchid Chetia, et al.
Publicado: (2025)
Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models
por: Wang, Ziyu, et al.
Publicado: (2024)
por: Wang, Ziyu, et al.
Publicado: (2024)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2024)
por: Zang, Yongyi, et al.
Publicado: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization
por: Shao, Keren, et al.
Publicado: (2025)
por: Shao, Keren, et al.
Publicado: (2025)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
por: Shen, Lipeng, et al.
Publicado: (2024)
por: Shen, Lipeng, et al.
Publicado: (2024)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
por: Biyani, Ishan D., et al.
Publicado: (2025)
por: Biyani, Ishan D., et al.
Publicado: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
por: Ferreira, Alef Iury Siqueira, et al.
Publicado: (2025)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
por: Zhang, You, et al.
Publicado: (2024)
por: Zhang, You, et al.
Publicado: (2024)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
por: Li, Jizhen, et al.
Publicado: (2024)
por: Li, Jizhen, et al.
Publicado: (2024)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
por: Clarke, Jason, et al.
Publicado: (2025)
por: Clarke, Jason, et al.
Publicado: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
por: Lin, Yueqian, et al.
Publicado: (2025)
por: Lin, Yueqian, et al.
Publicado: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026)
por: Jin, Ruinan, et al.
Publicado: (2026)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
por: Lin, Jinwei
Publicado: (2024)
por: Lin, Jinwei
Publicado: (2024)
Conformer-based Ultrasound-to-Speech Conversion
por: Ibrahimov, Ibrahim, et al.
Publicado: (2025)
por: Ibrahimov, Ibrahim, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
por: Li, Xiaolou, et al.
Publicado: (2024)
por: Li, Xiaolou, et al.
Publicado: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
Optimizing Feature Extraction for Symbolic Music
por: Simonetta, Federico, et al.
Publicado: (2023)
por: Simonetta, Federico, et al.
Publicado: (2023)
MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion
por: Li, Pengcheng, et al.
Publicado: (2024)
por: Li, Pengcheng, et al.
Publicado: (2024)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025)
por: Dai, Shuqi, et al.
Publicado: (2025)
EmoReg: Directional Latent Vector Modeling for Emotional Intensity Regularization in Diffusion-based Voice Conversion
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
por: Gudmalwar, Ashishkumar, et al.
Publicado: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
por: Li, Fengjin, et al.
Publicado: (2025)
por: Li, Fengjin, et al.
Publicado: (2025)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
por: Huang, Lian, et al.
Publicado: (2024)
por: Huang, Lian, et al.
Publicado: (2024)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Ejemplares similares
-
MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation
por: Wang, Zihao, et al.
Publicado: (2024) -
MuChin: A Chinese Colloquial Description Benchmark for Evaluating Language Models in the Field of Music
por: Wang, Zihao, et al.
Publicado: (2024) -
CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS
por: Zheng, Zihao, et al.
Publicado: (2026) -
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
por: Zheng, Zihao, et al.
Publicado: (2025) -
STAR: Speech-to-Audio Generation via Representation Learning
por: Xie, Zeyu, et al.
Publicado: (2025)