SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Jionghao, Shi, Jiatong, Someki, Masao, Tang, Yuxun, Liu, Lan, Zhao, Yiwen, Feng, Wenhao, Watanabe, Shinji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
par: Han, Jionghao, et autres
Publié: (2025)
par: Han, Jionghao, et autres
Publié: (2025)
Adapting Speech Language Model to Singing Voice Synthesis
par: Zhao, Yiwen, et autres
Publié: (2025)
par: Zhao, Yiwen, et autres
Publié: (2025)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
par: Tang, Yuxun, et autres
Publié: (2025)
par: Tang, Yuxun, et autres
Publié: (2025)
Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty
par: Zhao, Yiwen, et autres
Publié: (2025)
par: Zhao, Yiwen, et autres
Publié: (2025)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
VISinger2+: End-to-End Singing Voice Synthesis Augmented by Self-Supervised Learning Representation
par: Yu, Yifeng, et autres
Publié: (2024)
par: Yu, Yifeng, et autres
Publié: (2024)
SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
TokSing: Singing Voice Synthesis based on Discrete Tokens
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
ESPnet-SDS: Unified Toolkit and Demo for Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback
par: Arora, Siddhant, et autres
Publié: (2026)
par: Arora, Siddhant, et autres
Publié: (2026)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
par: Someki, Masao, et autres
Publié: (2024)
par: Someki, Masao, et autres
Publié: (2024)
Segment-Level Vectorized Beam Search Based on Partially Autoregressive Inference
par: Someki, Masao, et autres
Publié: (2023)
par: Someki, Masao, et autres
Publié: (2023)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
On-device Streaming Discrete Speech Units
par: Choi, Kwanghee, et autres
Publié: (2025)
par: Choi, Kwanghee, et autres
Publié: (2025)
Chain-of-Thought Training for Open E2E Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
par: Xue, Liumeng, et autres
Publié: (2024)
par: Xue, Liumeng, et autres
Publié: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025)
par: Dai, Shuqi, et autres
Publié: (2025)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
par: Zhang, You, et autres
Publié: (2024)
par: Zhang, You, et autres
Publié: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
par: Ivry, Amir, et autres
Publié: (2026)
par: Ivry, Amir, et autres
Publié: (2026)
Zero-Shot Sing Voice Conversion: built upon clustering-based phoneme representations
par: Zhou, Wangjin, et autres
Publié: (2024)
par: Zhou, Wangjin, et autres
Publié: (2024)
CoMoSVC: Consistency Model-based Singing Voice Conversion
par: Lu, Yiwen, et autres
Publié: (2024)
par: Lu, Yiwen, et autres
Publié: (2024)
Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling
par: Geng, Chen, et autres
Publié: (2026)
par: Geng, Chen, et autres
Publié: (2026)
SingFake: Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2023)
par: Zang, Yongyi, et autres
Publié: (2023)
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
par: Hu, Zhetao, et autres
Publié: (2026)
par: Hu, Zhetao, et autres
Publié: (2026)
Singing Voice Graph Modeling for SingFake Detection
par: Chen, Xuanjun, et autres
Publié: (2024)
par: Chen, Xuanjun, et autres
Publié: (2024)
YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases
par: Chen, Gongyu, et autres
Publié: (2025)
par: Chen, Gongyu, et autres
Publié: (2025)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
A Survey on 30+ Years of Automatic Singing Assessment and Singing Information Processing
par: Santos, Arthur N. dos, et autres
Publié: (2026)
par: Santos, Arthur N. dos, et autres
Publié: (2026)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
par: Jiang, Shaohan, et autres
Publié: (2025)
par: Jiang, Shaohan, et autres
Publié: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
par: Shi, Yufei, et autres
Publié: (2026)
par: Shi, Yufei, et autres
Publié: (2026)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Documents similaires
-
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
par: Han, Jionghao, et autres
Publié: (2025) -
Adapting Speech Language Model to Singing Voice Synthesis
par: Zhao, Yiwen, et autres
Publié: (2025) -
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
par: Tang, Yuxun, et autres
Publié: (2025) -
Robust Training of Singing Voice Synthesis Using Prior and Posterior Uncertainty
par: Zhao, Yiwen, et autres
Publié: (2025) -
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)