Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xueyan, Wang, Yuxin, Jiang, Mengjie, Zhu, Qingzi, Zhang, Jiang, Kim, Zoey, Niu, Yazhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme
di: Li, Xueyan, et al.
Pubblicazione: (2025)
di: Li, Xueyan, et al.
Pubblicazione: (2025)
BiSinger: Bilingual Singing Voice Synthesis
di: Zhou, Huali, et al.
Pubblicazione: (2023)
di: Zhou, Huali, et al.
Pubblicazione: (2023)
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps
di: Song, Yulin, et al.
Pubblicazione: (2024)
di: Song, Yulin, et al.
Pubblicazione: (2024)
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
di: Janiczek, John, et al.
Pubblicazione: (2024)
di: Janiczek, John, et al.
Pubblicazione: (2024)
DAFMSVC: One-Shot Singing Voice Conversion with Dual Attention Mechanism and Flow Matching
di: Chen, Wei, et al.
Pubblicazione: (2025)
di: Chen, Wei, et al.
Pubblicazione: (2025)
Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
di: Chen, Wei, et al.
Pubblicazione: (2025)
di: Chen, Wei, et al.
Pubblicazione: (2025)
Mitigating Unauthorized Speech Synthesis for Voice Protection
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2024)
CoMoSVC: Consistency Model-based Singing Voice Conversion
di: Lu, Yiwen, et al.
Pubblicazione: (2024)
di: Lu, Yiwen, et al.
Pubblicazione: (2024)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
di: Cui, Jianwei, et al.
Pubblicazione: (2024)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model
di: Li, Yan, et al.
Pubblicazione: (2024)
di: Li, Yan, et al.
Pubblicazione: (2024)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
di: Zeng, Chang, et al.
Pubblicazione: (2024)
di: Zeng, Chang, et al.
Pubblicazione: (2024)
kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization
di: Shao, Keren, et al.
Pubblicazione: (2025)
di: Shao, Keren, et al.
Pubblicazione: (2025)
Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
di: Watcharasupat, Karn N., et al.
Pubblicazione: (2024)
SafeSpeech: Robust and Universal Voice Protection Against Malicious Speech Synthesis
di: Zhang, Zhisheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2025)
Robust Singing Voice Transcription Serves Synthesis
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
voice2mode: Phonation Mode Classification in Singing using Self-Supervised Speech Models
di: Justus, Aju Ani, et al.
Pubblicazione: (2026)
di: Justus, Aju Ani, et al.
Pubblicazione: (2026)
TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
di: Kim, Seungmin, et al.
Pubblicazione: (2025)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis
di: Feng, Pengchao, et al.
Pubblicazione: (2025)
di: Feng, Pengchao, et al.
Pubblicazione: (2025)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Improving Generalization for AI-Synthesized Voice Detection
di: Ren, Hainan, et al.
Pubblicazione: (2024)
di: Ren, Hainan, et al.
Pubblicazione: (2024)
Adapting Speech Language Model to Singing Voice Synthesis
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control
di: Kumar, Sahil, et al.
Pubblicazione: (2026)
di: Kumar, Sahil, et al.
Pubblicazione: (2026)
AutoSchA: Automatic Hierarchical Music Representations via Multi-Relational Node Isolation
di: Ni-Hahn, Stephen, et al.
Pubblicazione: (2025)
di: Ni-Hahn, Stephen, et al.
Pubblicazione: (2025)
TokSing: Singing Voice Synthesis based on Discrete Tokens
di: Wu, Yuning, et al.
Pubblicazione: (2024)
di: Wu, Yuning, et al.
Pubblicazione: (2024)
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
di: Guo, Wenxiang, et al.
Pubblicazione: (2025)
di: Guo, Wenxiang, et al.
Pubblicazione: (2025)
Empowering LLMs in Decision Games through Algorithmic Data Synthesis
di: Wang, Haolin, et al.
Pubblicazione: (2025)
di: Wang, Haolin, et al.
Pubblicazione: (2025)
AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation
di: Lu, Yuxin, et al.
Pubblicazione: (2026)
di: Lu, Yuxin, et al.
Pubblicazione: (2026)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization
di: Tang, Beilong, et al.
Pubblicazione: (2025)
di: Tang, Beilong, et al.
Pubblicazione: (2025)
SongBsAb: A Dual Prevention Approach against Singing Voice Conversion based Illegal Song Covers
di: Chen, Guangke, et al.
Pubblicazione: (2024)
di: Chen, Guangke, et al.
Pubblicazione: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
di: Gu, Ke, et al.
Pubblicazione: (2025)
di: Gu, Ke, et al.
Pubblicazione: (2025)
Unified Acoustic Representations for Screening Neurological and Respiratory Pathologies from Voice
di: Piao, Ran, et al.
Pubblicazione: (2025)
di: Piao, Ran, et al.
Pubblicazione: (2025)
EEG-to-Voice Decoding of Spoken and Imagined speech Using Non-Invasive EEG
di: Park, Hanbeot, et al.
Pubblicazione: (2025)
di: Park, Hanbeot, et al.
Pubblicazione: (2025)
Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
di: Zhao, Yiwen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Perception to Punchline: Empowering VLM with the Art of In-the-wild Meme
di: Li, Xueyan, et al.
Pubblicazione: (2025) -
BiSinger: Bilingual Singing Voice Synthesis
di: Zhou, Huali, et al.
Pubblicazione: (2023) -
Prompt-Singer: Controllable Singing-Voice-Synthesis with Natural Language Prompt
di: Wang, Yongqi, et al.
Pubblicazione: (2024) -
ConSinger: Efficient High-Fidelity Singing Voice Generation with Minimal Steps
di: Song, Yulin, et al.
Pubblicazione: (2024) -
Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations
di: Kakoulidis, Panos, et al.
Pubblicazione: (2024)