Guardado en:
| Autores principales: | Wang, Zihao, Yuan, Ruibin, Geng, Ziqi, Li, Hengjia, Qu, Xingwei, Li, Xinyi, Chen, Songye, Fu, Haoying, Dannenberg, Roger B., Zhang, Kejun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2512.07005 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
por: Wang, Zihao, et al.
Publicado: (2025)
por: Wang, Zihao, et al.
Publicado: (2025)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025)
por: Dai, Shuqi, et al.
Publicado: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
por: Shi, Yufei, et al.
Publicado: (2026)
por: Shi, Yufei, et al.
Publicado: (2026)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022)
por: Xie, Xurong, et al.
Publicado: (2022)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
por: Cheripally, Sowmya
Publicado: (2024)
por: Cheripally, Sowmya
Publicado: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents
por: Owodunni, Abraham Toluwase, et al.
Publicado: (2024)
por: Owodunni, Abraham Toluwase, et al.
Publicado: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
por: Zhou, Xuehao, et al.
Publicado: (2024)
por: Zhou, Xuehao, et al.
Publicado: (2024)
Singing Voice Graph Modeling for SingFake Detection
por: Chen, Xuanjun, et al.
Publicado: (2024)
por: Chen, Xuanjun, et al.
Publicado: (2024)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
por: Tang, Yuxun, et al.
Publicado: (2025)
por: Tang, Yuxun, et al.
Publicado: (2025)
CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data
por: Bai, Qibing, et al.
Publicado: (2026)
por: Bai, Qibing, et al.
Publicado: (2026)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
por: Tang, Yuxun, et al.
Publicado: (2024)
por: Tang, Yuxun, et al.
Publicado: (2024)
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation
por: Zhong, Jinzuomu, et al.
Publicado: (2024)
por: Zhong, Jinzuomu, et al.
Publicado: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
por: Huang, Wen-Chin, et al.
Publicado: (2026)
por: Huang, Wen-Chin, et al.
Publicado: (2026)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
por: Jiang, Shaohan, et al.
Publicado: (2025)
por: Jiang, Shaohan, et al.
Publicado: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
por: Cheng, Zhuangfei, et al.
Publicado: (2025)
por: Cheng, Zhuangfei, et al.
Publicado: (2025)
CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation
por: Han, Jionghao, et al.
Publicado: (2025)
por: Han, Jionghao, et al.
Publicado: (2025)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
por: Bafna, Niyati, et al.
Publicado: (2025)
por: Bafna, Niyati, et al.
Publicado: (2025)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Contrastive Regularization for Accent-Robust ASR
por: Thai, Van-Phat, et al.
Publicado: (2026)
por: Thai, Van-Phat, et al.
Publicado: (2026)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
Spectral Mapping of Singing Voices: U-Net-Assisted Vocal Segmentation
por: Sorrenti, Adam
Publicado: (2024)
por: Sorrenti, Adam
Publicado: (2024)
SingFake: Singing Voice Deepfake Detection
por: Zang, Yongyi, et al.
Publicado: (2023)
por: Zang, Yongyi, et al.
Publicado: (2023)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
por: Kim, Jaeyoung, et al.
Publicado: (2024)
por: Kim, Jaeyoung, et al.
Publicado: (2024)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
por: Sasu, David, et al.
Publicado: (2025)
por: Sasu, David, et al.
Publicado: (2025)
PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech
por: Menta, Venkata Pushpak Teja
Publicado: (2026)
por: Menta, Venkata Pushpak Teja
Publicado: (2026)
Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures
por: Plaja-Roglans, Genís, et al.
Publicado: (2025)
por: Plaja-Roglans, Genís, et al.
Publicado: (2025)
TokSing: Singing Voice Synthesis based on Discrete Tokens
por: Wu, Yuning, et al.
Publicado: (2024)
por: Wu, Yuning, et al.
Publicado: (2024)
SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
por: Han, Jionghao, et al.
Publicado: (2025)
por: Han, Jionghao, et al.
Publicado: (2025)
Controllable Accent Normalization via Discrete Diffusion
por: Bai, Qibing, et al.
Publicado: (2026)
por: Bai, Qibing, et al.
Publicado: (2026)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
por: Yong, Zheng-Xin, et al.
Publicado: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications
por: Wee, Marcus Yu Zhe, et al.
Publicado: (2025)
por: Wee, Marcus Yu Zhe, et al.
Publicado: (2025)
YingMusic-SVC: Real-World Robust Zero-Shot Singing Voice Conversion with Flow-GRPO and Singing-Specific Inductive Biases
por: Chen, Gongyu, et al.
Publicado: (2025)
por: Chen, Gongyu, et al.
Publicado: (2025)
Poly-SVC: Polyphony-Aware Singing Voice Conversion with Harmonic Modeling
por: Geng, Chen, et al.
Publicado: (2026)
por: Geng, Chen, et al.
Publicado: (2026)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
por: Wei, Haojie, et al.
Publicado: (2024)
por: Wei, Haojie, et al.
Publicado: (2024)
A Survey on 30+ Years of Automatic Singing Assessment and Singing Information Processing
por: Santos, Arthur N. dos, et al.
Publicado: (2026)
por: Santos, Arthur N. dos, et al.
Publicado: (2026)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
por: Zeng, Chang, et al.
Publicado: (2024)
por: Zeng, Chang, et al.
Publicado: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
por: Sha, Binzhu, et al.
Publicado: (2023)
por: Sha, Binzhu, et al.
Publicado: (2023)
Ejemplares similares
-
Singing Timbre Popularity Assessment Based on Multimodal Large Foundation Model
por: Wang, Zihao, et al.
Publicado: (2025) -
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025) -
UniVocal: Unified Speech-Singing Code-Switching Synthesis
por: Shi, Yufei, et al.
Publicado: (2026) -
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
por: Xie, Xurong, et al.
Publicado: (2022) -
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025)