Enregistré dans:
| Auteurs principaux: | Chen, Jiatao, Tang, Xing, Duan, Xiaoyue, Feng, Yutang, Zhang, Jinchao, Zhou, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.08233 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
par: Guo, Wenxiang, et autres
Publié: (2025)
par: Guo, Wenxiang, et autres
Publié: (2025)
Diffusion-based Symbolic Music Generation with Structured State Space Models
par: Yuan, Shenghua, et autres
Publié: (2025)
par: Yuan, Shenghua, et autres
Publié: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
par: Yang, Yuguang, et autres
Publié: (2024)
par: Yang, Yuguang, et autres
Publié: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
par: Ni, Qinke, et autres
Publié: (2026)
par: Ni, Qinke, et autres
Publié: (2026)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2023)
par: Zhang, Yu, et autres
Publié: (2023)
Melodic and Metrical Elements of Expressiveness in Hindustani Vocal Music
par: Bhake, Yash, et autres
Publié: (2025)
par: Bhake, Yash, et autres
Publié: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
par: Kim, Tae-Woo, et autres
Publié: (2022)
par: Kim, Tae-Woo, et autres
Publié: (2022)
Timbre Perception, Representation, and its Neuroscientific Exploration: A Comprehensive Review
par: Zhang, Hong, et autres
Publié: (2024)
par: Zhang, Hong, et autres
Publié: (2024)
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
par: Han, Jionghao, et autres
Publié: (2025)
par: Han, Jionghao, et autres
Publié: (2025)
Research on Piano Timbre Transformation System Based on Diffusion Model
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance
par: Zhao, Junchuan, et autres
Publié: (2025)
par: Zhao, Junchuan, et autres
Publié: (2025)
BiSinger: Bilingual Singing Voice Synthesis
par: Zhou, Huali, et autres
Publié: (2023)
par: Zhou, Huali, et autres
Publié: (2023)
SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture
par: Sui, Kehan, et autres
Publié: (2025)
par: Sui, Kehan, et autres
Publié: (2025)
Wavetable Synthesis Using CVAE for Timbre Control Based on Semantic Label
par: Yutani, Tsugumasa, et autres
Publié: (2024)
par: Yutani, Tsugumasa, et autres
Publié: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
A Semantic Timbre Dataset for the Electric Guitar
par: Cameron, Joseph, et autres
Publié: (2026)
par: Cameron, Joseph, et autres
Publié: (2026)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
par: Chen, Jiatao, et autres
Publié: (2024)
par: Chen, Jiatao, et autres
Publié: (2024)
The First Voice Timbre Attribute Detection Challenge
par: Chen, Liping, et autres
Publié: (2025)
par: Chen, Liping, et autres
Publié: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
par: Shi, Yufei, et autres
Publié: (2026)
par: Shi, Yufei, et autres
Publié: (2026)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
par: Deng, Wei, et autres
Publié: (2025)
par: Deng, Wei, et autres
Publié: (2025)
YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance
par: Hao, Chunbo, et autres
Publié: (2026)
par: Hao, Chunbo, et autres
Publié: (2026)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
par: Li, Zehua Kcriss, et autres
Publié: (2024)
par: Li, Zehua Kcriss, et autres
Publié: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Evaluating Latent Space Structure in Timbre VAEs: A Comparative Study of Unsupervised, Descriptor-Conditioned, and Perceptual Feature-Conditioned Models
par: Cameron, Joseph, et autres
Publié: (2026)
par: Cameron, Joseph, et autres
Publié: (2026)
Synthetic Singers: A Review of Deep-Learning-based Singing Voice Synthesis Approaches
par: Pan, Changhao, et autres
Publié: (2026)
par: Pan, Changhao, et autres
Publié: (2026)
Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems
par: Chen, Leduo, et autres
Publié: (2026)
par: Chen, Leduo, et autres
Publié: (2026)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
par: Wang, Qi, et autres
Publié: (2026)
par: Wang, Qi, et autres
Publié: (2026)
NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations
par: Xue, Liumeng, et autres
Publié: (2026)
par: Xue, Liumeng, et autres
Publié: (2026)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
par: Wu, Zhiyu, et autres
Publié: (2025)
par: Wu, Zhiyu, et autres
Publié: (2025)
Timbre Difference Capturing in Anomalous Sound Detection
par: Nishida, Tomoya, et autres
Publié: (2024)
par: Nishida, Tomoya, et autres
Publié: (2024)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
par: Feng, Pengchao, et autres
Publié: (2025)
par: Feng, Pengchao, et autres
Publié: (2025)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
par: Kim, Sungjae, et autres
Publié: (2022)
par: Kim, Sungjae, et autres
Publié: (2022)
YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
par: Cho, Deok-Hyeon, et autres
Publié: (2026)
par: Cho, Deok-Hyeon, et autres
Publié: (2026)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
par: Baoueb, Teysir, et autres
Publié: (2024)
par: Baoueb, Teysir, et autres
Publié: (2024)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
par: Tian, Haokun, et autres
Publié: (2025)
par: Tian, Haokun, et autres
Publié: (2025)
Singer separation for karaoke content generation
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
par: Lin, Hsuan-Yu, et autres
Publié: (2021)
Documents similaires
-
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
par: Guo, Wenxiang, et autres
Publié: (2025) -
Diffusion-based Symbolic Music Generation with Structured State Space Models
par: Yuan, Shenghua, et autres
Publié: (2025) -
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
par: Yang, Yuguang, et autres
Publié: (2024) -
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
par: Ni, Qinke, et autres
Publié: (2026) -
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
par: Zhang, Yu, et autres
Publié: (2023)