Source Separation of Multi-source Raw Music using a Residual Quantized Variational Autoencoder
Fuente:
arXiv
Salvato in:
| Autore principale: | Berti, Leonardo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Siamese Residual Neural Network for Musical Shape Evaluation in Piano Performance Assessment
di: Li, Xiaoquan, et al.
Pubblicazione: (2024)
di: Li, Xiaoquan, et al.
Pubblicazione: (2024)
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
di: Spanio, Matteo, et al.
Pubblicazione: (2026)
di: Spanio, Matteo, et al.
Pubblicazione: (2026)
Music102: An $D_{12}$-equivariant transformer for chord progression accompaniment
di: Luo, Weiliang
Pubblicazione: (2024)
di: Luo, Weiliang
Pubblicazione: (2024)
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021)
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
di: Wang, Wupeng, et al.
Pubblicazione: (2024)
di: Wang, Wupeng, et al.
Pubblicazione: (2024)
Improving BERT for Symbolic Music Understanding Using Token Denoising and Pianoroll Prediction
di: Wang, Jun-You, et al.
Pubblicazione: (2025)
di: Wang, Jun-You, et al.
Pubblicazione: (2025)
MIDI-GPT: A Controllable Generative Model for Computer-Assisted Multitrack Music Composition
di: Pasquier, Philippe, et al.
Pubblicazione: (2025)
di: Pasquier, Philippe, et al.
Pubblicazione: (2025)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
di: Liu, Renhang, et al.
Pubblicazione: (2024)
di: Liu, Renhang, et al.
Pubblicazione: (2024)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Cinematic Audio Source Separation Using Visual Cues
di: Zhang, Kang, et al.
Pubblicazione: (2026)
di: Zhang, Kang, et al.
Pubblicazione: (2026)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
di: Lin, Meng-Ping, et al.
Pubblicazione: (2025)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
di: Song, Zeyang, et al.
Pubblicazione: (2025)
di: Song, Zeyang, et al.
Pubblicazione: (2025)
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
Spectron: Target Speaker Extraction using Conditional Transformer with Adversarial Refinement
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
di: Bandyopadhyay, Tathagata
Pubblicazione: (2024)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
Automatic Music Transcription using Convolutional Neural Networks and Constant-Q transform
di: Telila, Yohannis, et al.
Pubblicazione: (2025)
di: Telila, Yohannis, et al.
Pubblicazione: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
di: Li, Yupei, et al.
Pubblicazione: (2024)
di: Li, Yupei, et al.
Pubblicazione: (2024)
MR-MT3: Memory Retaining Multi-Track Music Transcription to Mitigate Instrument Leakage
di: Tan, Hao Hao, et al.
Pubblicazione: (2024)
di: Tan, Hao Hao, et al.
Pubblicazione: (2024)
Flexible Control in Symbolic Music Generation via Musical Metadata
di: Han, Sangjun, et al.
Pubblicazione: (2024)
di: Han, Sangjun, et al.
Pubblicazione: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
di: Qian, Yikai, et al.
Pubblicazione: (2024)
di: Qian, Yikai, et al.
Pubblicazione: (2024)
Generative AI for Music and Audio
di: Dong, Hao-Wen
Pubblicazione: (2024)
di: Dong, Hao-Wen
Pubblicazione: (2024)
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
di: Long, Phillip, et al.
Pubblicazione: (2024)
di: Long, Phillip, et al.
Pubblicazione: (2024)
Learning Normal Patterns in Musical Loops
di: Dadman, Shayan, et al.
Pubblicazione: (2025)
di: Dadman, Shayan, et al.
Pubblicazione: (2025)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
di: Liu, Shansong, et al.
Pubblicazione: (2023)
di: Liu, Shansong, et al.
Pubblicazione: (2023)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
di: Liu, Shansong, et al.
Pubblicazione: (2024)
di: Liu, Shansong, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
Optimizing Feature Extraction for Symbolic Music
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
di: Pina, Leonardo, et al.
Pubblicazione: (2024)
di: Pina, Leonardo, et al.
Pubblicazione: (2024)
Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation
di: Yu, Jun, et al.
Pubblicazione: (2024)
di: Yu, Jun, et al.
Pubblicazione: (2024)
Compression of Higher Order Ambisonics with Multichannel RVQGAN
di: Hirvonen, Toni, et al.
Pubblicazione: (2024)
di: Hirvonen, Toni, et al.
Pubblicazione: (2024)
A Recurrent Neural Network Approach to the Answering Machine Detection Problem
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Siamese Residual Neural Network for Musical Shape Evaluation in Piano Performance Assessment
di: Li, Xiaoquan, et al.
Pubblicazione: (2024) -
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
di: Spanio, Matteo, et al.
Pubblicazione: (2026) -
Music102: An $D_{12}$-equivariant transformer for chord progression accompaniment
di: Luo, Weiliang
Pubblicazione: (2024) -
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
di: Chou, Yi-Hui, et al.
Pubblicazione: (2021) -
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
di: Wang, Wupeng, et al.
Pubblicazione: (2024)