Adapting Speech Language Model to Singing Voice Synthesis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Yiwen, Shi, Jiatong, Tian, Jinchuan, Tang, Yuxun, Hai, Jiarui, Han, Jionghao, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty
von: Zhao, Yiwen, et al.
Veröffentlicht: (2025)
von: Zhao, Yiwen, et al.
Veröffentlicht: (2025)
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
von: Han, Jionghao, et al.
Veröffentlicht: (2025)
von: Han, Jionghao, et al.
Veröffentlicht: (2025)
SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
von: Han, Jionghao, et al.
Veröffentlicht: (2025)
von: Han, Jionghao, et al.
Veröffentlicht: (2025)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
von: Yu, Yifeng, et al.
Veröffentlicht: (2024)
von: Yu, Yifeng, et al.
Veröffentlicht: (2024)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
von: Wu, Yuning, et al.
Veröffentlicht: (2024)
von: Wu, Yuning, et al.
Veröffentlicht: (2024)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
von: Tang, Yuxun, et al.
Veröffentlicht: (2025)
von: Tang, Yuxun, et al.
Veröffentlicht: (2025)
TokSing: Singing Voice Synthesis based on Discrete Tokens
von: Wu, Yuning, et al.
Veröffentlicht: (2024)
von: Wu, Yuning, et al.
Veröffentlicht: (2024)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
von: Tang, Yuxun, et al.
Veröffentlicht: (2024)
von: Tang, Yuxun, et al.
Veröffentlicht: (2024)
SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
von: Tang, Yuxun, et al.
Veröffentlicht: (2024)
von: Tang, Yuxun, et al.
Veröffentlicht: (2024)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
von: Zhang, You, et al.
Veröffentlicht: (2024)
von: Zhang, You, et al.
Veröffentlicht: (2024)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
von: Zang, Yongyi, et al.
Veröffentlicht: (2024)
von: Zang, Yongyi, et al.
Veröffentlicht: (2024)
Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks
von: Wang, Shih-Heng, et al.
Veröffentlicht: (2026)
von: Wang, Shih-Heng, et al.
Veröffentlicht: (2026)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
von: Chang, Xuankai, et al.
Veröffentlicht: (2024)
von: Chang, Xuankai, et al.
Veröffentlicht: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
Uni-VERSA: Versatile Speech Assessment with a Unified Network
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
von: Maekaku, Takashi, et al.
Veröffentlicht: (2025)
von: Maekaku, Takashi, et al.
Veröffentlicht: (2025)
Online Register for Dual-Mode Self-Supervised Speech Models: Mitigating The Lack of Future Context
von: Goto, Keita, et al.
Veröffentlicht: (2026)
von: Goto, Keita, et al.
Veröffentlicht: (2026)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
von: Shi, Jiatong, et al.
Veröffentlicht: (2025)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
von: Arora, Siddhant, et al.
Veröffentlicht: (2026)
von: Arora, Siddhant, et al.
Veröffentlicht: (2026)
Towards Robust Speech Representation Learning for Thousands of Languages
von: Chen, William, et al.
Veröffentlicht: (2024)
von: Chen, William, et al.
Veröffentlicht: (2024)
OpusLM: A Family of Open Unified Speech Language Models
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2025)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
von: Dai, Shuqi, et al.
Veröffentlicht: (2025)
von: Dai, Shuqi, et al.
Veröffentlicht: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
von: Tian, Jinchuan, et al.
Veröffentlicht: (2024)
von: Tian, Jinchuan, et al.
Veröffentlicht: (2024)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
von: Shi, Jiatong, et al.
Veröffentlicht: (2024)
SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models
von: Wan, Zhen, et al.
Veröffentlicht: (2025)
von: Wan, Zhen, et al.
Veröffentlicht: (2025)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
von: Zhang, You, et al.
Veröffentlicht: (2024)
von: Zhang, You, et al.
Veröffentlicht: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
von: Li, Ruiqi, et al.
Veröffentlicht: (2024)
von: Li, Ruiqi, et al.
Veröffentlicht: (2024)
Robust Singing Voice Transcription Serves Synthesis
von: Li, Ruiqi, et al.
Veröffentlicht: (2024)
von: Li, Ruiqi, et al.
Veröffentlicht: (2024)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
von: Violeta, Lester Phillip, et al.
Veröffentlicht: (2025)
von: Violeta, Lester Phillip, et al.
Veröffentlicht: (2025)
TechSinger: Technique Controllable Multilingual Singing Voice Synthesis via Flow Matching
von: Guo, Wenxiang, et al.
Veröffentlicht: (2025)
von: Guo, Wenxiang, et al.
Veröffentlicht: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
von: Shi, Yufei, et al.
Veröffentlicht: (2026)
von: Shi, Yufei, et al.
Veröffentlicht: (2026)
BiSinger: Bilingual Singing Voice Synthesis
von: Zhou, Huali, et al.
Veröffentlicht: (2023)
von: Zhou, Huali, et al.
Veröffentlicht: (2023)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
von: Wang, Wei, et al.
Veröffentlicht: (2025)
von: Wang, Wei, et al.
Veröffentlicht: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
von: Arora, Siddhant, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty
von: Zhao, Yiwen, et al.
Veröffentlicht: (2025) -
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
von: Han, Jionghao, et al.
Veröffentlicht: (2025) -
SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
von: Han, Jionghao, et al.
Veröffentlicht: (2025) -
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
von: Yu, Yifeng, et al.
Veröffentlicht: (2024) -
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
von: Wu, Yuning, et al.
Veröffentlicht: (2024)