YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chang, Sungkyun, Benetos, Emmanouil, Kirchhoff, Holger, Dixon, Simon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
di: Chang, Sungkyun, et al.
Pubblicazione: (2025)
di: Chang, Sungkyun, et al.
Pubblicazione: (2025)
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss
di: Huang, Jiawen, et al.
Pubblicazione: (2025)
di: Huang, Jiawen, et al.
Pubblicazione: (2025)
Enhanced Automatic Drum Transcription via Drum Stem Source Separation
di: Riley, Xavier, et al.
Pubblicazione: (2025)
di: Riley, Xavier, et al.
Pubblicazione: (2025)
A Data-Driven Analysis of Robust Automatic Piano Transcription
di: Edwards, Drew, et al.
Pubblicazione: (2024)
di: Edwards, Drew, et al.
Pubblicazione: (2024)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
di: Huang, Jiawen, et al.
Pubblicazione: (2024)
di: Huang, Jiawen, et al.
Pubblicazione: (2024)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2024)
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2024)
Learning Music Audio Representations With Limited Data
di: Plachouras, Christos, et al.
Pubblicazione: (2025)
di: Plachouras, Christos, et al.
Pubblicazione: (2025)
Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2025)
di: Papaioannou, Charilaos, et al.
Pubblicazione: (2025)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
CrossMuSim: A Cross-Modal Framework for Music Similarity Retrieval with LLM-Powered Text Description Sourcing and Mining
di: Tsoi, Tristan, et al.
Pubblicazione: (2025)
di: Tsoi, Tristan, et al.
Pubblicazione: (2025)
Domain-Invariant Representation Learning of Bird Sounds
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
SCRAPL: Scattering Transform with Random Paths for Machine Learning
di: Mitcheltree, Christopher, et al.
Pubblicazione: (2026)
di: Mitcheltree, Christopher, et al.
Pubblicazione: (2026)
GAPS: A Large and Diverse Classical Guitar Dataset and Benchmark Transcription Model
di: Riley, Xavier, et al.
Pubblicazione: (2024)
di: Riley, Xavier, et al.
Pubblicazione: (2024)
WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation
di: Karystinaios, Emmanouil
Pubblicazione: (2025)
di: Karystinaios, Emmanouil
Pubblicazione: (2025)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Score-Informed Transformer for Refining MIDI Velocity in Automatic Music Transcription
di: He, Zhanhong, et al.
Pubblicazione: (2025)
di: He, Zhanhong, et al.
Pubblicazione: (2025)
Language Models for Music Medicine Generation
di: Nikolakakis, Emmanouil, et al.
Pubblicazione: (2024)
di: Nikolakakis, Emmanouil, et al.
Pubblicazione: (2024)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
High Resolution Guitar Transcription via Domain Adaptation
di: Riley, Xavier, et al.
Pubblicazione: (2024)
di: Riley, Xavier, et al.
Pubblicazione: (2024)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
di: Ma, Yinghao, et al.
Pubblicazione: (2025)
di: Ma, Yinghao, et al.
Pubblicazione: (2025)
How does the teacher rate? Observations from the NeuroPiano dataset
di: Zhang, Huan, et al.
Pubblicazione: (2024)
di: Zhang, Huan, et al.
Pubblicazione: (2024)
Acoustic identification of individual animals with hierarchical contrastive learning
di: Nolasco, Ines, et al.
Pubblicazione: (2024)
di: Nolasco, Ines, et al.
Pubblicazione: (2024)
LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging
di: Singh, Shubhr, et al.
Pubblicazione: (2025)
di: Singh, Shubhr, et al.
Pubblicazione: (2025)
SMUG-Explain: A Framework for Symbolic Music Graph Explanations
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
ImprovNet -- Generating Controllable Musical Improvisations with Iterative Corruption Refinement
di: Bhandari, Keshav, et al.
Pubblicazione: (2025)
di: Bhandari, Keshav, et al.
Pubblicazione: (2025)
Moonbeam: A MIDI Foundation Model Using Both Absolute and Relative Music Attributes
di: Guo, Zixun, et al.
Pubblicazione: (2025)
di: Guo, Zixun, et al.
Pubblicazione: (2025)
Towards Musically Informed Evaluation of Piano Transcription Models
di: Hu, Patricia, et al.
Pubblicazione: (2024)
di: Hu, Patricia, et al.
Pubblicazione: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
Stem-JEPA: A Joint-Embedding Predictive Architecture for Musical Stem Compatibility Estimation
di: Riou, Alain, et al.
Pubblicazione: (2024)
di: Riou, Alain, et al.
Pubblicazione: (2024)
Exploiting Music Source Separation for Automatic Lyrics Transcription with Whisper
di: Syed, Jaza, et al.
Pubblicazione: (2025)
di: Syed, Jaza, et al.
Pubblicazione: (2025)
ACMID: Automatic Curation of Musical Instrument Dataset for 7-Stem Music Source Separation
di: Yu, Ji, et al.
Pubblicazione: (2025)
di: Yu, Ji, et al.
Pubblicazione: (2025)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
di: Steinmetz, Christian J., et al.
Pubblicazione: (2024)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
di: Riley, Xavier, et al.
Pubblicazione: (2024)
di: Riley, Xavier, et al.
Pubblicazione: (2024)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
di: Elisha, Shahar, et al.
Pubblicazione: (2024)
di: Elisha, Shahar, et al.
Pubblicazione: (2024)
Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures
di: Riou, Alain, et al.
Pubblicazione: (2024)
di: Riou, Alain, et al.
Pubblicazione: (2024)
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
di: Zhuo, Le, et al.
Pubblicazione: (2023)
di: Zhuo, Le, et al.
Pubblicazione: (2023)
MR-MT3: Memory Retaining Multi-Track Music Transcription to Mitigate Instrument Leakage
di: Tan, Hao Hao, et al.
Pubblicazione: (2024)
di: Tan, Hao Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
di: Chang, Sungkyun, et al.
Pubblicazione: (2025) -
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss
di: Huang, Jiawen, et al.
Pubblicazione: (2025) -
Enhanced Automatic Drum Transcription via Drum Stem Source Separation
di: Riley, Xavier, et al.
Pubblicazione: (2025) -
A Data-Driven Analysis of Robust Automatic Piano Transcription
di: Edwards, Drew, et al.
Pubblicazione: (2024) -
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
di: Huang, Jiawen, et al.
Pubblicazione: (2024)