M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Shansong, Hussain, Atin Sakkeer, Wu, Qilong, Sun, Chenshuo, Shan, Ying |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024)
por: Liu, Shansong, et al.
Publicado: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
por: Li, Yupei, et al.
Publicado: (2024)
por: Li, Yupei, et al.
Publicado: (2024)
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024)
por: Han, Sangjun, et al.
Publicado: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)
por: Salganik, Rebecca, et al.
Publicado: (2026)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024)
por: Zhou, Ziya, et al.
Publicado: (2024)
A Survey on Evaluation Metrics for Music Generation
por: Kader, Faria Binte, et al.
Publicado: (2025)
por: Kader, Faria Binte, et al.
Publicado: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
por: Zhao, Qihao, et al.
Publicado: (2026)
por: Zhao, Qihao, et al.
Publicado: (2026)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)
por: Huang, Qiaochu, et al.
Publicado: (2024)
Dance-to-Music Generation with Encoder-based Textual Inversion
por: Li, Sifei, et al.
Publicado: (2024)
por: Li, Sifei, et al.
Publicado: (2024)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024)
por: Yang, Kaixing, et al.
Publicado: (2024)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
por: Zhang, Liqian, et al.
Publicado: (2024)
por: Zhang, Liqian, et al.
Publicado: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
por: Li, Xiaojie, et al.
Publicado: (2025)
por: Li, Xiaojie, et al.
Publicado: (2025)
M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection
por: Wang, Anna, et al.
Publicado: (2024)
por: Wang, Anna, et al.
Publicado: (2024)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
por: Devaney, Johanna, et al.
Publicado: (2024)
por: Devaney, Johanna, et al.
Publicado: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
por: Qian, Yikai, et al.
Publicado: (2024)
por: Qian, Yikai, et al.
Publicado: (2024)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
MusicScore: A Dataset for Music Score Modeling and Generation
por: Lin, Yuheng, et al.
Publicado: (2024)
por: Lin, Yuheng, et al.
Publicado: (2024)
A Survey of Foundation Models for Music Understanding
por: Li, Wenjun, et al.
Publicado: (2024)
por: Li, Wenjun, et al.
Publicado: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
por: Chen, Gehui, et al.
Publicado: (2024)
por: Chen, Gehui, et al.
Publicado: (2024)
Optimizing Feature Extraction for Symbolic Music
por: Simonetta, Federico, et al.
Publicado: (2023)
por: Simonetta, Federico, et al.
Publicado: (2023)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
A Survey on Multimodal Music Emotion Recognition
por: Liyanarachchi, Rashini, et al.
Publicado: (2025)
por: Liyanarachchi, Rashini, et al.
Publicado: (2025)
Emotion-Aligned Contrastive Learning Between Images and Music
por: Stewart, Shanti, et al.
Publicado: (2023)
por: Stewart, Shanti, et al.
Publicado: (2023)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
por: Stewart, Shanti, et al.
Publicado: (2024)
por: Stewart, Shanti, et al.
Publicado: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
por: Li, Sifei, et al.
Publicado: (2025)
por: Li, Sifei, et al.
Publicado: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
por: You, Fuming, et al.
Publicado: (2024)
por: You, Fuming, et al.
Publicado: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
por: Doh, Seungheon, et al.
Publicado: (2025)
por: Doh, Seungheon, et al.
Publicado: (2025)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
por: Wu, Junxian, et al.
Publicado: (2025)
por: Wu, Junxian, et al.
Publicado: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
por: Zuo, Heda, et al.
Publicado: (2025)
por: Zuo, Heda, et al.
Publicado: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
por: Ren, Yong, et al.
Publicado: (2025)
por: Ren, Yong, et al.
Publicado: (2025)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
por: Pina, Leonardo, et al.
Publicado: (2024)
por: Pina, Leonardo, et al.
Publicado: (2024)
Ejemplares similares
-
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
por: Liu, Shansong, et al.
Publicado: (2024) -
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024) -
M6: Multi-generator, Multi-domain, Multi-lingual and cultural, Multi-genres, Multi-instrument Machine-Generated Music Detection Databases
por: Li, Yupei, et al.
Publicado: (2024) -
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024) -
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
por: Salganik, Rebecca, et al.
Publicado: (2026)