Enregistré dans:
| Auteurs principaux: | Hu, Zhetao, Zhou, Yiquan, Wang, Wenyu, Wu, Zhiyu, Gao, Xin, Zhu, Jihua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.05526 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
par: Zhou, Yiquan, et autres
Publié: (2025)
par: Zhou, Yiquan, et autres
Publié: (2025)
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
par: Wang, Wenyu, et autres
Publié: (2025)
par: Wang, Wenyu, et autres
Publié: (2025)
AVENet: Disentangling Features by Approximating Average Features for Voice Conversion
par: Wang, Wenyu, et autres
Publié: (2025)
par: Wang, Wenyu, et autres
Publié: (2025)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
par: Huang, Yubo, et autres
Publié: (2024)
par: Huang, Yubo, et autres
Publié: (2024)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
par: Bai, Bingsong, et autres
Publié: (2024)
par: Bai, Bingsong, et autres
Publié: (2024)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
par: Liu, Ke, et autres
Publié: (2026)
par: Liu, Ke, et autres
Publié: (2026)
YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases
par: Chen, Gongyu, et autres
Publié: (2025)
par: Chen, Gongyu, et autres
Publié: (2025)
DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
par: Liu, Yisi, et autres
Publié: (2026)
par: Liu, Yisi, et autres
Publié: (2026)
Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
par: Huang, Pu, et autres
Publié: (2025)
par: Huang, Pu, et autres
Publié: (2025)
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
par: Dhar, Sandipan, et autres
Publié: (2025)
par: Dhar, Sandipan, et autres
Publié: (2025)
IndexTTS 2.5 Technical Report
par: Li, Yunpei, et autres
Publié: (2026)
par: Li, Yunpei, et autres
Publié: (2026)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotation
par: Guo, Wenxiang, et autres
Publié: (2025)
par: Guo, Wenxiang, et autres
Publié: (2025)
Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu
Publié: (2025)
par: Kim, Nam-Gyu
Publié: (2025)
FGCL: Fine-grained Contrastive Learning For Mandarin Stuttering Event Detection
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance
par: Zhao, Junchuan, et autres
Publié: (2025)
par: Zhao, Junchuan, et autres
Publié: (2025)
SingFake: Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2023)
par: Zang, Yongyi, et autres
Publié: (2023)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
par: Tang, Yuxun, et autres
Publié: (2025)
par: Tang, Yuxun, et autres
Publié: (2025)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
par: Luo, Dan, et autres
Publié: (2025)
par: Luo, Dan, et autres
Publié: (2025)
Sing-On-Your-Beat: Simple Text-Controllable Accompaniment Generations
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
par: Trinh, Quoc-Huy, et autres
Publié: (2024)
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
par: Ok, Hyunjong, et autres
Publié: (2024)
par: Ok, Hyunjong, et autres
Publié: (2024)
CoMoSVC: Consistency Model-based Singing Voice Conversion
par: Lu, Yiwen, et autres
Publié: (2024)
par: Lu, Yiwen, et autres
Publié: (2024)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
par: Weng, Yuzhe, et autres
Publié: (2026)
par: Weng, Yuzhe, et autres
Publié: (2026)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
R2-SVC: Towards Real-World Robust and Expressive Zero-shot Singing Voice Conversion
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
par: Choi, Joon-Seung, et autres
Publié: (2025)
par: Choi, Joon-Seung, et autres
Publié: (2025)
DiTSinger: Scaling Singing Voice Synthesis with Diffusion Transformer and Implicit Alignment
par: Du, Zongcai, et autres
Publié: (2025)
par: Du, Zongcai, et autres
Publié: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
Controllable Singing Voice Synthesis using Phoneme-Level Energy Sequence
par: Ryu, Yerin, et autres
Publié: (2025)
par: Ryu, Yerin, et autres
Publié: (2025)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
Structure-Aware Piano Accompaniment via Style Planning and Dataset-Aligned Pattern Retrieval
par: Zang, Wanyu, et autres
Publié: (2026)
par: Zang, Wanyu, et autres
Publié: (2026)
Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
par: Liu, Changsong, et autres
Publié: (2026)
par: Liu, Changsong, et autres
Publié: (2026)
Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures
par: Plaja-Roglans, Genís, et autres
Publié: (2025)
par: Plaja-Roglans, Genís, et autres
Publié: (2025)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
par: Guragain, Anmol, et autres
Publié: (2024)
par: Guragain, Anmol, et autres
Publié: (2024)
Music Style Transfer With Diffusion Model
par: Huang, Hong, et autres
Publié: (2024)
par: Huang, Hong, et autres
Publié: (2024)
SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture
par: Sui, Kehan, et autres
Publié: (2025)
par: Sui, Kehan, et autres
Publié: (2025)
Documents similaires
-
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
par: Zhou, Yiquan, et autres
Publié: (2025) -
FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
par: Wang, Wenyu, et autres
Publié: (2025) -
AVENet: Disentangling Features by Approximating Average Features for Voice Conversion
par: Wang, Wenyu, et autres
Publié: (2025) -
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
par: Huang, Yubo, et autres
Publié: (2024) -
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
par: Bai, Bingsong, et autres
Publié: (2024)