Mustango: Toward Controllable Text-to-Music Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Melechovsky, Jan, Guo, Zixun, Ghosal, Deepanway, Majumder, Navonil, Herremans, Dorien, Poria, Soujanya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model
di: Kang, Jaeyong, et al.
Pubblicazione: (2023)
di: Kang, Jaeyong, et al.
Pubblicazione: (2023)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
di: Melechovsky, Jan, et al.
Pubblicazione: (2022)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
MidiCaps: A large-scale MIDI dataset with text captions
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
MelodySim: Measuring Melody-aware Music Similarity for Plagiarism Detection
di: Lu, Tongyu, et al.
Pubblicazione: (2025)
di: Lu, Tongyu, et al.
Pubblicazione: (2025)
Towards Unified Music Emotion Recognition across Dimensional and Categorical Models
di: Kang, Jaeyong, et al.
Pubblicazione: (2025)
di: Kang, Jaeyong, et al.
Pubblicazione: (2025)
Aligning Generative Music AI with Human Preferences: Methods and Challenges
di: Herremans, Dorien, et al.
Pubblicazione: (2025)
di: Herremans, Dorien, et al.
Pubblicazione: (2025)
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
di: Melechovsky, Jan, et al.
Pubblicazione: (2025)
Are We There Yet? A Brief Survey of Music Emotion Prediction Datasets, Models and Outstanding Challenges
di: Kang, Jaeyong, et al.
Pubblicazione: (2024)
di: Kang, Jaeyong, et al.
Pubblicazione: (2024)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
di: Luo, Jing, et al.
Pubblicazione: (2024)
di: Luo, Jing, et al.
Pubblicazione: (2024)
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
di: Wang, Kyra, et al.
Pubblicazione: (2024)
di: Wang, Kyra, et al.
Pubblicazione: (2024)
PRESENT: Zero-Shot Text-to-Prosody Control
di: Lam, Perry, et al.
Pubblicazione: (2024)
di: Lam, Perry, et al.
Pubblicazione: (2024)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
di: Liu, Renhang, et al.
Pubblicazione: (2024)
di: Liu, Renhang, et al.
Pubblicazione: (2024)
Text2midi: Generating Symbolic Music from Captions
di: Bhandari, Keshav, et al.
Pubblicazione: (2024)
di: Bhandari, Keshav, et al.
Pubblicazione: (2024)
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
di: Hung, Chia-Yu, et al.
Pubblicazione: (2024)
di: Hung, Chia-Yu, et al.
Pubblicazione: (2024)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control
di: Zhang, Shaozuo, et al.
Pubblicazione: (2025)
di: Zhang, Shaozuo, et al.
Pubblicazione: (2025)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
di: Lam, Perry, et al.
Pubblicazione: (2022)
di: Lam, Perry, et al.
Pubblicazione: (2022)
ImprovNet -- Generating Controllable Musical Improvisations with Iterative Corruption Refinement
di: Bhandari, Keshav, et al.
Pubblicazione: (2025)
di: Bhandari, Keshav, et al.
Pubblicazione: (2025)
Natural Language Processing Methods for Symbolic Music Generation and Information Retrieval: a Survey
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2024)
di: Le, Dinh-Viet-Toan, et al.
Pubblicazione: (2024)
MIRFLEX: Music Information Retrieval Feature Library for Extraction
di: Chopra, Anuradha, et al.
Pubblicazione: (2024)
di: Chopra, Anuradha, et al.
Pubblicazione: (2024)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
di: Li, Yingting, et al.
Pubblicazione: (2024)
di: Li, Yingting, et al.
Pubblicazione: (2024)
Moonbeam: A MIDI Foundation Model Using Both Absolute and Relative Music Attributes
di: Guo, Zixun, et al.
Pubblicazione: (2025)
di: Guo, Zixun, et al.
Pubblicazione: (2025)
A Domain-Knowledge-Inspired Music Embedding Space and a Novel Attention Mechanism for Symbolic Music Modeling
di: Guo, Z., et al.
Pubblicazione: (2022)
di: Guo, Z., et al.
Pubblicazione: (2022)
Text-to-Song: Towards Controllable Music Generation Incorporating Vocals and Accompaniment
di: Hong, Zhiqing, et al.
Pubblicazione: (2024)
di: Hong, Zhiqing, et al.
Pubblicazione: (2024)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
di: Li, Yingting, et al.
Pubblicazione: (2024)
di: Li, Yingting, et al.
Pubblicazione: (2024)
DiffRoll: Diffusion-based Generative Music Transcription with Unsupervised Pretraining Capability
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
di: Cheuk, Kin Wai, et al.
Pubblicazione: (2022)
Improving Controllability and Editability for Pretrained Text-to-Music Generation Models
di: Zhang, Yixiao
Pubblicazione: (2024)
di: Zhang, Yixiao
Pubblicazione: (2024)
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
GD-Retriever: Controllable Generative Text-Music Retrieval with Diffusion Models
di: Guinot, Julien, et al.
Pubblicazione: (2025)
di: Guinot, Julien, et al.
Pubblicazione: (2025)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
di: Tal, Or, et al.
Pubblicazione: (2024)
di: Tal, Or, et al.
Pubblicazione: (2024)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
di: Ma, Linhan, et al.
Pubblicazione: (2025)
di: Ma, Linhan, et al.
Pubblicazione: (2025)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
ACE-Step: A Step Towards Music Generation Foundation Model
di: Gong, Junmin, et al.
Pubblicazione: (2025)
di: Gong, Junmin, et al.
Pubblicazione: (2025)
FakeMusicCaps: a Dataset for Detection and Attribution of Synthetic Music Generated via Text-to-Music Models
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
di: Comanducci, Luca, et al.
Pubblicazione: (2024)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
Editing Music with Melody and Text: Using ControlNet for Diffusion Transformer
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
di: Hou, Siyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model
di: Kang, Jaeyong, et al.
Pubblicazione: (2023) -
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
di: Majumder, Navonil, et al.
Pubblicazione: (2024) -
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024) -
Accented Text-to-Speech Synthesis with a Conditional Variational Autoencoder
di: Melechovsky, Jan, et al.
Pubblicazione: (2022) -
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)