Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bai, Ye, Li, Chenxing, Li, Hao, Zhao, Yuanyuan, Wang, Xiaorui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025)
par: Dai, Shuqi, et autres
Publié: (2025)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
par: Wei, Haojie, et autres
Publié: (2024)
par: Wei, Haojie, et autres
Publié: (2024)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation
par: Watcharasupat, Karn N., et autres
Publié: (2024)
par: Watcharasupat, Karn N., et autres
Publié: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
par: Sha, Binzhu, et autres
Publié: (2023)
par: Sha, Binzhu, et autres
Publié: (2023)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Robust Singing Voice Transcription Serves Synthesis
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Zero-Shot Duet Singing Voices Separation with Diffusion Models
par: Yu, Chin-Yun, et autres
Publié: (2023)
par: Yu, Chin-Yun, et autres
Publié: (2023)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
par: Kim, Tae-Woo, et autres
Publié: (2022)
par: Kim, Tae-Woo, et autres
Publié: (2022)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
par: Zhang, Daning, et autres
Publié: (2025)
par: Zhang, Daning, et autres
Publié: (2025)
SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
par: Zhou, Yiquan, et autres
Publié: (2025)
par: Zhou, Yiquan, et autres
Publié: (2025)
SingIt! Singer Voice Transformation
par: Eliav, Amit, et autres
Publié: (2024)
par: Eliav, Amit, et autres
Publié: (2024)
TokSing: Singing Voice Synthesis based on Discrete Tokens
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schrödinger Bridge
par: Zhao, Zijing, et autres
Publié: (2025)
par: Zhao, Zijing, et autres
Publié: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
par: Gu, Yicheng, et autres
Publié: (2025)
par: Gu, Yicheng, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
EDSep: An Effective Diffusion-Based Method for Speech Source Separation
par: Dong, Jinwei, et autres
Publié: (2025)
par: Dong, Jinwei, et autres
Publié: (2025)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
par: Jiang, Shaohan, et autres
Publié: (2025)
par: Jiang, Shaohan, et autres
Publié: (2025)
SingOMD: Singing Oriented Multi-resolution Discrete Representation Construction from Speech Models
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
par: Shi, Runwu, et autres
Publié: (2025)
par: Shi, Runwu, et autres
Publié: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
par: Yin, Han, et autres
Publié: (2024)
par: Yin, Han, et autres
Publié: (2024)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
par: Bai, Bingsong, et autres
Publié: (2024)
par: Bai, Bingsong, et autres
Publié: (2024)
Singing Voice Graph Modeling for SingFake Detection
par: Chen, Xuanjun, et autres
Publié: (2024)
par: Chen, Xuanjun, et autres
Publié: (2024)
Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
par: Zhang, Xueyao, et autres
Publié: (2023)
par: Zhang, Xueyao, et autres
Publié: (2023)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm
par: Wu, Yuning, et autres
Publié: (2024)
par: Wu, Yuning, et autres
Publié: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
par: Jung, Jihoo, et autres
Publié: (2026)
par: Jung, Jihoo, et autres
Publié: (2026)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
par: Violeta, Lester Phillip, et autres
Publié: (2025)
par: Violeta, Lester Phillip, et autres
Publié: (2025)
UniSep: Universal Target Audio Separation with Language Models at Scale
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Task-Aware Unified Source Separation
par: Saijo, Kohei, et autres
Publié: (2024)
par: Saijo, Kohei, et autres
Publié: (2024)
Documents similaires
-
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024) -
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
par: Dai, Shuqi, et autres
Publié: (2025) -
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
par: Wei, Haojie, et autres
Publié: (2024) -
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024) -
Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation
par: Watcharasupat, Karn N., et autres
Publié: (2024)