MR-MT3: Memory Retaining Multi-Track Music Transcription to Mitigate Instrument Leakage
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Hao Hao, Cheuk, Kin Wai, Cho, Taemin, Liao, Wei-Hsiang, Mitsufuji, Yuki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Timbre-Trap: A Low-Resource Framework for Instrument-Agnostic Music Transcription
di: Cwitkowitz, Frank, et al.
Pubblicazione: (2023)
di: Cwitkowitz, Frank, et al.
Pubblicazione: (2023)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Automatic Music Mixing using a Generative Model of Effect Embeddings
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
di: Kim, Haven, et al.
Pubblicazione: (2025)
di: Kim, Haven, et al.
Pubblicazione: (2025)
A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
di: Ishii, Masato, et al.
Pubblicazione: (2024)
di: Ishii, Masato, et al.
Pubblicazione: (2024)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
di: Li, Sifei, et al.
Pubblicazione: (2025)
di: Li, Sifei, et al.
Pubblicazione: (2025)
Flexible Control in Symbolic Music Generation via Musical Metadata
di: Han, Sangjun, et al.
Pubblicazione: (2024)
di: Han, Sangjun, et al.
Pubblicazione: (2024)
Large-Scale Training Data Attribution for Music Generative Models via Unlearning
di: Choi, Woosung, et al.
Pubblicazione: (2025)
di: Choi, Woosung, et al.
Pubblicazione: (2025)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
di: Qian, Yikai, et al.
Pubblicazione: (2024)
di: Qian, Yikai, et al.
Pubblicazione: (2024)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
Optimizing Feature Extraction for Symbolic Music
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
di: Simonetta, Federico, et al.
Pubblicazione: (2023)
A Survey on Evaluation Metrics for Music Generation
di: Kader, Faria Binte, et al.
Pubblicazione: (2025)
di: Kader, Faria Binte, et al.
Pubblicazione: (2025)
A Survey on Multimodal Music Emotion Recognition
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
Dance-to-Music Generation with Encoder-based Textual Inversion
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
Emotion-Aligned Contrastive Learning Between Images and Music
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
di: Stewart, Shanti, et al.
Pubblicazione: (2024)
di: Stewart, Shanti, et al.
Pubblicazione: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
di: Veerendranath, Vishruth, et al.
Pubblicazione: (2024)
di: Veerendranath, Vishruth, et al.
Pubblicazione: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
di: Yao, Dong, et al.
Pubblicazione: (2023)
di: Yao, Dong, et al.
Pubblicazione: (2023)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025)
di: Song, Jiahao, et al.
Pubblicazione: (2025)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
di: You, Fuming, et al.
Pubblicazione: (2024)
di: You, Fuming, et al.
Pubblicazione: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
di: Huang, Qiaochu, et al.
Pubblicazione: (2024)
di: Huang, Qiaochu, et al.
Pubblicazione: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
di: Li, Xiaojie, et al.
Pubblicazione: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
di: Yang, Kaixing, et al.
Pubblicazione: (2024)
di: Yang, Kaixing, et al.
Pubblicazione: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
di: Liu, Shansong, et al.
Pubblicazione: (2023)
di: Liu, Shansong, et al.
Pubblicazione: (2023)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
di: Wang, Yutian, et al.
Pubblicazione: (2024)
di: Wang, Yutian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025) -
Timbre-Trap: A Low-Resource Framework for Instrument-Agnostic Music Transcription
di: Cwitkowitz, Frank, et al.
Pubblicazione: (2023) -
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024) -
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
di: Doh, Seungheon, et al.
Pubblicazione: (2025) -
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)