DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Zongcai, Deng, Guilin, Guo, Xiaofeng, Gao, Xin, Li, Linke, Cheng, Kaichang, Han, Fubo, Yang, Siyu, Liu, Peng, Zhong, Pan, Fu, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SingIt! Singer Voice Transformation
par: Eliav, Amit, et autres
Publié: (2024)
par: Eliav, Amit, et autres
Publié: (2024)
TokSing: Singing Voice Synthesis based on Discrete Tokens
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025)
par: Dai, Shuqi, et autres
Publié: (2025)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Zero-Shot Duet Singing Voices Separation with Diffusion Models
par: Yu, Chin-Yun, et autres
Publié: (2023)
par: Yu, Chin-Yun, et autres
Publié: (2023)
RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis
par: Sui, Kehan, et autres
Publié: (2024)
par: Sui, Kehan, et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
par: Kim, Tae-Woo, et autres
Publié: (2022)
par: Kim, Tae-Woo, et autres
Publié: (2022)
Singing Voice Synthesis Using Differentiable LPC and Glottal-Flow-Inspired Wavetables
par: Yu, Chin-Yun, et autres
Publié: (2023)
par: Yu, Chin-Yun, et autres
Publié: (2023)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
par: Jiang, Shaohan, et autres
Publié: (2025)
par: Jiang, Shaohan, et autres
Publié: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
Synthetic Singers: A Review of Deep-Learning-based Singing Voice Synthesis Approaches
par: Pan, Changhao, et autres
Publié: (2026)
par: Pan, Changhao, et autres
Publié: (2026)
VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schrödinger Bridge
par: Zhao, Zijing, et autres
Publié: (2025)
par: Zhao, Zijing, et autres
Publié: (2025)
BiSinger: Bilingual Singing Voice Synthesis
par: Zhou, Huali, et autres
Publié: (2023)
par: Zhou, Huali, et autres
Publié: (2023)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
par: Yang, Runxuan, et autres
Publié: (2025)
par: Yang, Runxuan, et autres
Publié: (2025)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
par: Yu, Yifeng, et autres
Publié: (2024)
par: Yu, Yifeng, et autres
Publié: (2024)
A Preliminary Investigation on Flexible Singing Voice Synthesis Through Decomposed Framework with Inferrable Features
par: Violeta, Lester Phillip, et autres
Publié: (2024)
par: Violeta, Lester Phillip, et autres
Publié: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
SingFake: Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2023)
par: Zang, Yongyi, et autres
Publié: (2023)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
par: Xue, Liumeng, et autres
Publié: (2024)
par: Xue, Liumeng, et autres
Publié: (2024)
Singing Voice Graph Modeling for SingFake Detection
par: Chen, Xuanjun, et autres
Publié: (2024)
par: Chen, Xuanjun, et autres
Publié: (2024)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
par: Kim, Taewoo, et autres
Publié: (2024)
par: Kim, Taewoo, et autres
Publié: (2024)
Accompanied Singing Voice Synthesis with Fully Text-controlled Melody
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion
par: Ferreira, Alef Iury Siqueira, et autres
Publié: (2025)
par: Ferreira, Alef Iury Siqueira, et autres
Publié: (2025)
YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance
par: Hao, Chunbo, et autres
Publié: (2026)
par: Hao, Chunbo, et autres
Publié: (2026)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2023)
par: Zhang, Yu, et autres
Publié: (2023)
Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
par: Ryu, Yerin, et autres
Publié: (2025)
par: Ryu, Yerin, et autres
Publié: (2025)
TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Documents similaires
-
SingIt! Singer Voice Transformation
par: Eliav, Amit, et autres
Publié: (2024) -
TokSing: Singing Voice Synthesis based on Discrete Tokens
par: Wu, Yuning, et autres
Publié: (2024) -
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024) -
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024) -
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025)