Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Ju-Chiang, Lu, Wei-Tsung, Chen, Jitong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GAN
par: Morocutti, Tobias, et autres
Publié: (2026)
par: Morocutti, Tobias, et autres
Publié: (2026)
Vocal Melody Construction for Persian Lyrics Using LSTM Recurrent Neural Networks
par: Jafari, Farshad, et autres
Publié: (2024)
par: Jafari, Farshad, et autres
Publié: (2024)
Temporal Adaptation of Pre-trained Foundation Models for Music Structure Analysis
par: Zhang, Yixiao, et autres
Publié: (2025)
par: Zhang, Yixiao, et autres
Publié: (2025)
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
par: Wei, Haojie, et autres
Publié: (2024)
par: Wei, Haojie, et autres
Publié: (2024)
CVSM: Contrastive Vocal Similarity Modeling
par: Garoufis, Christos, et autres
Publié: (2025)
par: Garoufis, Christos, et autres
Publié: (2025)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
par: Wei, Haojie, et autres
Publié: (2023)
par: Wei, Haojie, et autres
Publié: (2023)
Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster Model
par: Lu, Minhui, et autres
Publié: (2026)
par: Lu, Minhui, et autres
Publié: (2026)
Melodic and Metrical Elements of Expressiveness in Hindustani Vocal Music
par: Bhake, Yash, et autres
Publié: (2025)
par: Bhake, Yash, et autres
Publié: (2025)
Auditory Representation Effective for Estimating Vocal Tract Information
par: Irino, Toshio, et autres
Publié: (2023)
par: Irino, Toshio, et autres
Publié: (2023)
Biodenoising: Animal Vocalization Denoising without Access to Clean Data
par: Miron, Marius, et autres
Publié: (2024)
par: Miron, Marius, et autres
Publié: (2024)
A Reliable and Efficient Detection Pipeline for Rodent Ultrasonic Vocalizations
par: Anis, Sabah Shahnoor, et autres
Publié: (2025)
par: Anis, Sabah Shahnoor, et autres
Publié: (2025)
Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
par: Nobukawa, Rinka, et autres
Publié: (2025)
par: Nobukawa, Rinka, et autres
Publié: (2025)
DiffVox: A Differentiable Model for Capturing and Analysing Vocal Effects Distributions
par: Yu, Chin-Yun, et autres
Publié: (2025)
par: Yu, Chin-Yun, et autres
Publié: (2025)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
voc2vec: A Foundation Model for Non-Verbal Vocalization
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
par: Kim, Yubin, et autres
Publié: (2025)
par: Kim, Yubin, et autres
Publié: (2025)
Mamba2 Meets Silence: Robust Vocal Source Separation for Sparse Regions
par: Kim, Euiyeon, et autres
Publié: (2025)
par: Kim, Euiyeon, et autres
Publié: (2025)
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis
par: Li, Jialu, et autres
Publié: (2023)
par: Li, Jialu, et autres
Publié: (2023)
Live Vocal Extraction from K-pop Performances
par: Kim, Yujin, et autres
Publié: (2025)
par: Kim, Yujin, et autres
Publié: (2025)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
par: Maghsoudi, Maryam, et autres
Publié: (2026)
par: Maghsoudi, Maryam, et autres
Publié: (2026)
Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
par: Chen, Yu-Wen, et autres
Publié: (2025)
par: Chen, Yu-Wen, et autres
Publié: (2025)
Note-Level Singing Melody Transcription for Time-Aligned Musical Score Generation
par: Kim, Leekyung, et autres
Publié: (2025)
par: Kim, Leekyung, et autres
Publié: (2025)
Towards the Synthesis of Non-speech Vocalizations
par: Hoq, Enjamamul, et autres
Publié: (2024)
par: Hoq, Enjamamul, et autres
Publié: (2024)
Small Tunes Transformer: Exploring Macro & Micro-Level Hierarchies for Skeleton-Conditioned Melody Generation
par: Lv, Yishan, et autres
Publié: (2024)
par: Lv, Yishan, et autres
Publié: (2024)
ChunkFormer: Masked Chunking Conformer For Long-Form Speech Transcription
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Computational Extraction of Intonation and Tuning Systems from Multiple Microtonal Monophonic Vocal Recordings with Diverse Modes
par: Shafiei, Sepideh, et autres
Publié: (2025)
par: Shafiei, Sepideh, et autres
Publié: (2025)
Feature Representations for Automatic Meerkat Vocalization Classification
par: Mahmoud, Imen Ben, et autres
Publié: (2024)
par: Mahmoud, Imen Ben, et autres
Publié: (2024)
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
par: Fan, Cunhang, et autres
Publié: (2025)
par: Fan, Cunhang, et autres
Publié: (2025)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
Automatic Melody Reduction via Shortest Path Finding
par: Wang, Ziyu, et autres
Publié: (2025)
par: Wang, Ziyu, et autres
Publié: (2025)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
par: Ni, Qinke, et autres
Publié: (2026)
par: Ni, Qinke, et autres
Publié: (2026)
Melody-Guided Music Generation
par: Wei, Shaopeng, et autres
Publié: (2024)
par: Wei, Shaopeng, et autres
Publié: (2024)
RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
Multimodal Laryngoscopic Video Analysis for Assisted Diagnosis of Vocal Fold Paralysis
par: Zhang, Yucong, et autres
Publié: (2024)
par: Zhang, Yucong, et autres
Publié: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
par: Hou, Siyuan, et autres
Publié: (2024)
par: Hou, Siyuan, et autres
Publié: (2024)
MelodySim: Measuring Melody-aware Music Similarity for Plagiarism Detection
par: Lu, Tongyu, et autres
Publié: (2025)
par: Lu, Tongyu, et autres
Publié: (2025)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
par: Guo, Hongming, et autres
Publié: (2024)
par: Guo, Hongming, et autres
Publié: (2024)
Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper
par: Syed, Jaza, et autres
Publié: (2025)
par: Syed, Jaza, et autres
Publié: (2025)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
par: von Neumann, Thilo, et autres
Publié: (2023)
par: von Neumann, Thilo, et autres
Publié: (2023)
Documents similaires
-
Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GAN
par: Morocutti, Tobias, et autres
Publié: (2026) -
Vocal Melody Construction for Persian Lyrics Using LSTM Recurrent Neural Networks
par: Jafari, Farshad, et autres
Publié: (2024) -
Temporal Adaptation of Pre-trained Foundation Models for Music Structure Analysis
par: Zhang, Yixiao, et autres
Publié: (2025) -
DJCM: A Deep Joint Cascade Model for Singing Voice Separation and Vocal Pitch Estimation
par: Wei, Haojie, et autres
Publié: (2024) -
CVSM: Contrastive Vocal Similarity Modeling
par: Garoufis, Christos, et autres
Publié: (2025)