M2M-Gen: A Multimodal Framework for Automated Background Music Generation in Japanese Manga Using Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sharma, Megha, Haseeb, Muhammad Taimoor, Xia, Gus, Tsuruoka, Yoshimasa |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Model Mapping in Multimodal Music Learning: A Grand Challenge Proposal
par: Chin, Daniel, et autres
Publié: (2025)
par: Chin, Daniel, et autres
Publié: (2025)
Content-based Controls For Music Large Language Modeling
par: Lin, Liwei, et autres
Publié: (2023)
par: Lin, Liwei, et autres
Publié: (2023)
Who Gets Heard? Rethinking Fairness in AI for Music Systems
par: Mehta, Atharva, et autres
Publié: (2025)
par: Mehta, Atharva, et autres
Publié: (2025)
TOMI: Transforming and Organizing Music Ideas for Multi-Track Compositions with Full-Song Structure
par: He, Qi, et autres
Publié: (2025)
par: He, Qi, et autres
Publié: (2025)
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
par: Lin, Liwei, et autres
Publié: (2024)
par: Lin, Liwei, et autres
Publié: (2024)
Exploring GPT's Ability as a Judge in Music Understanding
par: Fang, Kun, et autres
Publié: (2025)
par: Fang, Kun, et autres
Publié: (2025)
CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages
par: Wu, Shangda, et autres
Publié: (2025)
par: Wu, Shangda, et autres
Publié: (2025)
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
par: Wang, Yashan, et autres
Publié: (2025)
par: Wang, Yashan, et autres
Publié: (2025)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
par: Izzati, Fathinah, et autres
Publié: (2025)
par: Izzati, Fathinah, et autres
Publié: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
Whole-Song Hierarchical Generation of Symbolic Music Using Cascaded Diffusion Models
par: Wang, Ziyu, et autres
Publié: (2024)
par: Wang, Ziyu, et autres
Publié: (2024)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
par: Zhang, Yixiao, et autres
Publié: (2024)
par: Zhang, Yixiao, et autres
Publié: (2024)
Automatic Melody Reduction via Shortest Path Finding
par: Wang, Ziyu, et autres
Publié: (2025)
par: Wang, Ziyu, et autres
Publié: (2025)
Seed-Music: A Unified Framework for High Quality and Controlled Music Generation
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Language Models for Music Medicine Generation
par: Nikolakakis, Emmanouil, et autres
Publié: (2024)
par: Nikolakakis, Emmanouil, et autres
Publié: (2024)
TALKPLAY: Multimodal Music Recommendation with Large Language Models
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
Large Language Models: From Notes to Musical Form
par: Atassi, Lilac
Publié: (2024)
par: Atassi, Lilac
Publié: (2024)
Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization
par: Ou, Longshen, et autres
Publié: (2024)
par: Ou, Longshen, et autres
Publié: (2024)
WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation
par: Karystinaios, Emmanouil
Publié: (2025)
par: Karystinaios, Emmanouil
Publié: (2025)
FruitsMusic: A Real-World Corpus of Japanese Idol-Group Songs
par: Suda, Hitoshi, et autres
Publié: (2024)
par: Suda, Hitoshi, et autres
Publié: (2024)
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
par: Wu, Shangda, et autres
Publié: (2024)
par: Wu, Shangda, et autres
Publié: (2024)
MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
par: Rouard, Simon, et autres
Publié: (2025)
par: Rouard, Simon, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Core Music Perception Tasks
par: Carone, Brandon James, et autres
Publié: (2025)
par: Carone, Brandon James, et autres
Publié: (2025)
Music Discovery Dialogue Generation Using Human Intent Analysis and Large Language Models
par: Doh, SeungHeon, et autres
Publié: (2024)
par: Doh, SeungHeon, et autres
Publié: (2024)
Large-Scale Training Data Attribution for Music Generative Models via Unlearning
par: Choi, Woosung, et autres
Publié: (2025)
par: Choi, Woosung, et autres
Publié: (2025)
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
par: Zhang, Yixiao, et autres
Publié: (2024)
par: Zhang, Yixiao, et autres
Publié: (2024)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
par: Hyrkas, Jeremy
Publié: (2021)
par: Hyrkas, Jeremy
Publié: (2021)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
par: Comanducci, Luca, et autres
Publié: (2024)
par: Comanducci, Luca, et autres
Publié: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset
par: Xu, Weihan, et autres
Publié: (2024)
par: Xu, Weihan, et autres
Publié: (2024)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
par: Zhu, Boyu, et autres
Publié: (2025)
par: Zhu, Boyu, et autres
Publié: (2025)
Generating Rhythm Game Music with Jukebox
par: Yan, Nicholas
Publié: (2023)
par: Yan, Nicholas
Publié: (2023)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation
par: Lan, Yun-Han, et autres
Publié: (2024)
par: Lan, Yun-Han, et autres
Publié: (2024)
AI-Generated Music Detection and its Challenges
par: Afchar, Darius, et autres
Publié: (2025)
par: Afchar, Darius, et autres
Publié: (2025)
Documents similaires
-
Language Model Mapping in Multimodal Music Learning: A Grand Challenge Proposal
par: Chin, Daniel, et autres
Publié: (2025) -
Content-based Controls For Music Large Language Modeling
par: Lin, Liwei, et autres
Publié: (2023) -
Who Gets Heard? Rethinking Fairness in AI for Music Systems
par: Mehta, Atharva, et autres
Publié: (2025) -
TOMI: Transforming and Organizing Music Ideas for Multi-Track Compositions with Full-Song Structure
par: He, Qi, et autres
Publié: (2025) -
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
par: Lin, Liwei, et autres
Publié: (2024)