Guardado en:
| Autores principales: | Chen, Jiatao, Tang, Xing, Duan, Xiaoyue, Feng, Yutang, Zhang, Jinchao, Zhou, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.08233 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
por: Guo, Wenxiang, et al.
Publicado: (2025)
por: Guo, Wenxiang, et al.
Publicado: (2025)
Diffusion-based Symbolic Music Generation with Structured State Space Models
por: Yuan, Shenghua, et al.
Publicado: (2025)
por: Yuan, Shenghua, et al.
Publicado: (2025)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024)
por: Yang, Yuguang, et al.
Publicado: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
por: Zhang, Yu, et al.
Publicado: (2023)
por: Zhang, Yu, et al.
Publicado: (2023)
Melodic and Metrical Elements of Expressiveness in Hindustani Vocal Music
por: Bhake, Yash, et al.
Publicado: (2025)
por: Bhake, Yash, et al.
Publicado: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
por: Kim, Tae-Woo, et al.
Publicado: (2022)
por: Kim, Tae-Woo, et al.
Publicado: (2022)
Timbre Perception, Representation, and its Neuroscientific Exploration: A Comprehensive Review
por: Zhang, Hong, et al.
Publicado: (2024)
por: Zhang, Hong, et al.
Publicado: (2024)
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
por: Han, Jionghao, et al.
Publicado: (2025)
por: Han, Jionghao, et al.
Publicado: (2025)
Research on Piano Timbre Transformation System Based on Diffusion Model
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance
por: Zhao, Junchuan, et al.
Publicado: (2025)
por: Zhao, Junchuan, et al.
Publicado: (2025)
BiSinger: Bilingual Singing Voice Synthesis
por: Zhou, Huali, et al.
Publicado: (2023)
por: Zhou, Huali, et al.
Publicado: (2023)
SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture
por: Sui, Kehan, et al.
Publicado: (2025)
por: Sui, Kehan, et al.
Publicado: (2025)
Wavetable Synthesis Using CVAE for Timbre Control Based on Semantic Label
por: Yutani, Tsugumasa, et al.
Publicado: (2024)
por: Yutani, Tsugumasa, et al.
Publicado: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
por: Wang, Yongqi, et al.
Publicado: (2024)
por: Wang, Yongqi, et al.
Publicado: (2024)
A Semantic Timbre Dataset for the Electric Guitar
por: Cameron, Joseph, et al.
Publicado: (2026)
por: Cameron, Joseph, et al.
Publicado: (2026)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
por: Chen, Jiatao, et al.
Publicado: (2024)
por: Chen, Jiatao, et al.
Publicado: (2024)
The First Voice Timbre Attribute Detection Challenge
por: Chen, Liping, et al.
Publicado: (2025)
por: Chen, Liping, et al.
Publicado: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
por: Shi, Yufei, et al.
Publicado: (2026)
por: Shi, Yufei, et al.
Publicado: (2026)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance
por: Hao, Chunbo, et al.
Publicado: (2026)
por: Hao, Chunbo, et al.
Publicado: (2026)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
Evaluating Latent Space Structure in Timbre VAEs: A Comparative Study of Unsupervised, Descriptor-Conditioned, and Perceptual Feature-Conditioned Models
por: Cameron, Joseph, et al.
Publicado: (2026)
por: Cameron, Joseph, et al.
Publicado: (2026)
Synthetic Singers: A Review of Deep-Learning-based Singing Voice Synthesis Approaches
por: Pan, Changhao, et al.
Publicado: (2026)
por: Pan, Changhao, et al.
Publicado: (2026)
Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems
por: Chen, Leduo, et al.
Publicado: (2026)
por: Chen, Leduo, et al.
Publicado: (2026)
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
por: Wang, Qi, et al.
Publicado: (2026)
por: Wang, Qi, et al.
Publicado: (2026)
NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations
por: Xue, Liumeng, et al.
Publicado: (2026)
por: Xue, Liumeng, et al.
Publicado: (2026)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
por: Wu, Zhiyu, et al.
Publicado: (2025)
por: Wu, Zhiyu, et al.
Publicado: (2025)
Timbre Difference Capturing in Anomalous Sound Detection
por: Nishida, Tomoya, et al.
Publicado: (2024)
por: Nishida, Tomoya, et al.
Publicado: (2024)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
por: Feng, Pengchao, et al.
Publicado: (2025)
por: Feng, Pengchao, et al.
Publicado: (2025)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
por: Kim, Sungjae, et al.
Publicado: (2022)
por: Kim, Sungjae, et al.
Publicado: (2022)
YingMusic-Singer: Zero-shot Singing Voice Synthesis and Editing with Annotation-free Melody Guidance
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
por: Cho, Deok-Hyeon, et al.
Publicado: (2026)
por: Cho, Deok-Hyeon, et al.
Publicado: (2026)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
por: Baoueb, Teysir, et al.
Publicado: (2024)
por: Baoueb, Teysir, et al.
Publicado: (2024)
Assessing the Alignment of Audio Representations with Timbre Similarity Ratings
por: Tian, Haokun, et al.
Publicado: (2025)
por: Tian, Haokun, et al.
Publicado: (2025)
Singer separation for karaoke content generation
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
por: Lin, Hsuan-Yu, et al.
Publicado: (2021)
Ejemplares similares
-
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
por: Guo, Wenxiang, et al.
Publicado: (2025) -
Diffusion-based Symbolic Music Generation with Structured State Space Models
por: Yuan, Shenghua, et al.
Publicado: (2025) -
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
por: Yang, Yuguang, et al.
Publicado: (2024) -
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026) -
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
por: Zhang, Yu, et al.
Publicado: (2023)