Improving BERT for Symbolic Music Understanding Using Token Denoising and Pianoroll Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jun-You, Su, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
por: Chou, Yi-Hui, et al.
Publicado: (2021)
por: Chou, Yi-Hui, et al.
Publicado: (2021)
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024)
por: Han, Sangjun, et al.
Publicado: (2024)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
por: Liu, Renhang, et al.
Publicado: (2024)
por: Liu, Renhang, et al.
Publicado: (2024)
A Traditional Approach to Symbolic Piano Continuation
por: Zhou-Zheng, Christian, et al.
Publicado: (2025)
por: Zhou-Zheng, Christian, et al.
Publicado: (2025)
Optimizing Feature Extraction for Symbolic Music
por: Simonetta, Federico, et al.
Publicado: (2023)
por: Simonetta, Federico, et al.
Publicado: (2023)
Siamese Residual Neural Network for Musical Shape Evaluation in Piano Performance Assessment
por: Li, Xiaoquan, et al.
Publicado: (2024)
por: Li, Xiaoquan, et al.
Publicado: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
por: Qian, Yikai, et al.
Publicado: (2024)
por: Qian, Yikai, et al.
Publicado: (2024)
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
por: Long, Phillip, et al.
Publicado: (2024)
por: Long, Phillip, et al.
Publicado: (2024)
Efficient Fine-Grained Guidance for Diffusion Model Based Symbolic Music Generation
por: Zhu, Tingyu, et al.
Publicado: (2024)
por: Zhu, Tingyu, et al.
Publicado: (2024)
Segment-Factorized Full-Song Generation on Symbolic Piano Music
por: Chen, Ping-Yi, et al.
Publicado: (2025)
por: Chen, Ping-Yi, et al.
Publicado: (2025)
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
por: Spanio, Matteo, et al.
Publicado: (2026)
por: Spanio, Matteo, et al.
Publicado: (2026)
Music102: An $D_{12}$-equivariant transformer for chord progression accompaniment
por: Luo, Weiliang
Publicado: (2024)
por: Luo, Weiliang
Publicado: (2024)
Pianoroll-Event: A Novel Score Representation for Symbolic Music
por: Qian, Lekai, et al.
Publicado: (2026)
por: Qian, Lekai, et al.
Publicado: (2026)
MIDI-GPT: A Controllable Generative Model for Computer-Assisted Multitrack Music Composition
por: Pasquier, Philippe, et al.
Publicado: (2025)
por: Pasquier, Philippe, et al.
Publicado: (2025)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
por: Weck, Benno, et al.
Publicado: (2024)
por: Weck, Benno, et al.
Publicado: (2024)
Source Separation of Multi-source Raw Music using a Residual Quantized Variational Autoencoder
por: Berti, Leonardo
Publicado: (2024)
por: Berti, Leonardo
Publicado: (2024)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
por: You, Fuming, et al.
Publicado: (2024)
por: You, Fuming, et al.
Publicado: (2024)
A Dataset and Baselines for Measuring and Predicting the Music Piece Memorability
por: Tseng, Li-Yang, et al.
Publicado: (2024)
por: Tseng, Li-Yang, et al.
Publicado: (2024)
Multimodal Speech Enhancement Using Burst Propagation
por: Raza, Mohsin, et al.
Publicado: (2022)
por: Raza, Mohsin, et al.
Publicado: (2022)
Multi-Task Corrupted Prediction for Learning Robust Audio-Visual Speech Representation
por: Kim, Sungnyun, et al.
Publicado: (2025)
por: Kim, Sungnyun, et al.
Publicado: (2025)
Speech Separation with Pretrained Frontend to Minimize Domain Mismatch
por: Wang, Wupeng, et al.
Publicado: (2024)
por: Wang, Wupeng, et al.
Publicado: (2024)
Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation
por: Yu, Jun, et al.
Publicado: (2024)
por: Yu, Jun, et al.
Publicado: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
ComposerX: Multi-Agent Symbolic Music Composition with LLMs
por: Deng, Qixin, et al.
Publicado: (2024)
por: Deng, Qixin, et al.
Publicado: (2024)
Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
por: Zhang, Yixiao, et al.
Publicado: (2024)
por: Zhang, Yixiao, et al.
Publicado: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
por: Liu, Shansong, et al.
Publicado: (2023)
por: Liu, Shansong, et al.
Publicado: (2023)
JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models
por: Li, Peike, et al.
Publicado: (2023)
por: Li, Peike, et al.
Publicado: (2023)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024)
por: Liu, Shansong, et al.
Publicado: (2024)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
por: Zhang, Liqian, et al.
Publicado: (2024)
por: Zhang, Liqian, et al.
Publicado: (2024)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
Generative AI for Music and Audio
por: Dong, Hao-Wen
Publicado: (2024)
por: Dong, Hao-Wen
Publicado: (2024)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
por: Retkowski, Jan, et al.
Publicado: (2024)
por: Retkowski, Jan, et al.
Publicado: (2024)
IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
por: Song, Zeyang, et al.
Publicado: (2025)
por: Song, Zeyang, et al.
Publicado: (2025)
Ejemplares similares
-
BERT-like Pre-training for Symbolic Piano Music Classification Tasks
por: Chou, Yi-Hui, et al.
Publicado: (2021) -
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024) -
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
por: Liu, Renhang, et al.
Publicado: (2024) -
A Traditional Approach to Symbolic Piano Continuation
por: Zhou-Zheng, Christian, et al.
Publicado: (2025) -
Optimizing Feature Extraction for Symbolic Music
por: Simonetta, Federico, et al.
Publicado: (2023)