Improving Controllability and Editability for Pretrained Text-to-Music Generation Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhang, Yixiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Interpretation Gap in Text-to-Music Generation Models
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
di: Pei, Hanchen, et al.
Pubblicazione: (2026)
GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models
di: Guinot, Julien, et al.
Pubblicazione: (2025)
di: Guinot, Julien, et al.
Pubblicazione: (2025)
Temporal Adaptation of Pre-trained Foundation Models for Music Structure Analysis
di: Zhang, Yixiao, et al.
Pubblicazione: (2025)
di: Zhang, Yixiao, et al.
Pubblicazione: (2025)
Content-based Controls For Music Large Language Modeling
di: Lin, Liwei, et al.
Pubblicazione: (2023)
di: Lin, Liwei, et al.
Pubblicazione: (2023)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
Seed-Music: A Unified Framework for High Quality and Controlled Music Generation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
di: Lin, Liwei, et al.
Pubblicazione: (2024)
di: Lin, Liwei, et al.
Pubblicazione: (2024)
SLAP: Siamese Language-Audio Pretraining Without Negative Samples for Music Understanding
di: Guinot, Julien, et al.
Pubblicazione: (2025)
di: Guinot, Julien, et al.
Pubblicazione: (2025)
Intelligent Text-Conditioned Music Generation
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
di: Xie, Zhouyao, et al.
Pubblicazione: (2024)
Language Models for Music Medicine Generation
di: Nikolakakis, Emmanouil, et al.
Pubblicazione: (2024)
di: Nikolakakis, Emmanouil, et al.
Pubblicazione: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Improving Music Source Separation with Diffusion and Consistency Refinement
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
MuPT: A Generative Symbolic Music Pretrained Transformer
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
di: Qu, Xingwei, et al.
Pubblicazione: (2024)
Flexible Control in Symbolic Music Generation via Musical Metadata
di: Han, Sangjun, et al.
Pubblicazione: (2024)
di: Han, Sangjun, et al.
Pubblicazione: (2024)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
di: Wang, Yutian, et al.
Pubblicazione: (2024)
di: Wang, Yutian, et al.
Pubblicazione: (2024)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
di: Chen, Jiatao, et al.
Pubblicazione: (2024)
di: Chen, Jiatao, et al.
Pubblicazione: (2024)
Cacophony: An Improved Contrastive Audio-Text Model
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
Improving Musical Accompaniment Co-creation via Diffusion Transformers
di: Nistal, Javier, et al.
Pubblicazione: (2024)
di: Nistal, Javier, et al.
Pubblicazione: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
ACE-Step: A Step Towards Music Generation Foundation Model
di: Gong, Junmin, et al.
Pubblicazione: (2025)
di: Gong, Junmin, et al.
Pubblicazione: (2025)
Automatic Music Mixing using a Generative Model of Effect Embeddings
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
Generating Rhythm Game Music with Jukebox
di: Yan, Nicholas
Pubblicazione: (2023)
di: Yan, Nicholas
Pubblicazione: (2023)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
di: Du, Chenpeng, et al.
Pubblicazione: (2024)
di: Du, Chenpeng, et al.
Pubblicazione: (2024)
Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Large-Scale Training Data Attribution for Music Generative Models via Unlearning
di: Choi, Woosung, et al.
Pubblicazione: (2025)
di: Choi, Woosung, et al.
Pubblicazione: (2025)
Modeling the Difficulty of Saxophone Music
di: Libřický, Šimon, et al.
Pubblicazione: (2025)
di: Libřický, Šimon, et al.
Pubblicazione: (2025)
MusicFlow: Cascaded Flow Matching for Text Guided Music Generation
di: Prajwal, K R, et al.
Pubblicazione: (2024)
di: Prajwal, K R, et al.
Pubblicazione: (2024)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
AI-Generated Music Detection and its Challenges
di: Afchar, Darius, et al.
Pubblicazione: (2025)
di: Afchar, Darius, et al.
Pubblicazione: (2025)
High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
Semantic and Semiotic Interplays in Text-to-Audio AI: Exploring Cognitive Dynamics and Musical Interactions
di: Coelho, Guilherme
Pubblicazione: (2025)
di: Coelho, Guilherme
Pubblicazione: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
Documenti analoghi
-
The Interpretation Gap in Text-to-Music Generation Models
di: Zang, Yongyi, et al.
Pubblicazione: (2024) -
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
di: Pei, Hanchen, et al.
Pubblicazione: (2026) -
GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models
di: Guinot, Julien, et al.
Pubblicazione: (2025) -
Temporal Adaptation of Pre-trained Foundation Models for Music Structure Analysis
di: Zhang, Yixiao, et al.
Pubblicazione: (2025) -
Content-based Controls For Music Large Language Modeling
di: Lin, Liwei, et al.
Pubblicazione: (2023)