JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Peike, Chen, Boyu, Yao, Yao, Wang, Yikai, Wang, Allen, Wang, Alex |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
por: Yao, Yao, et al.
Publicado: (2023)
por: Yao, Yao, et al.
Publicado: (2023)
JEN-1 DreamStyler: Customized Musical Concept Learning via Pivotal Parameters Tuning
por: Chen, Boyu, et al.
Publicado: (2024)
por: Chen, Boyu, et al.
Publicado: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
por: Zhang, Yixiao, et al.
Publicado: (2024)
por: Zhang, Yixiao, et al.
Publicado: (2024)
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
por: Wang, Jinting, et al.
Publicado: (2025)
por: Wang, Jinting, et al.
Publicado: (2025)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
por: Yuan, Ruibin, et al.
Publicado: (2025)
por: Yuan, Ruibin, et al.
Publicado: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
por: Zuo, Heda, et al.
Publicado: (2025)
por: Zuo, Heda, et al.
Publicado: (2025)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
por: Retkowski, Jan, et al.
Publicado: (2024)
por: Retkowski, Jan, et al.
Publicado: (2024)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
por: Ji, Shulei, et al.
Publicado: (2023)
por: Ji, Shulei, et al.
Publicado: (2023)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
por: Wu, Junxian, et al.
Publicado: (2025)
por: Wu, Junxian, et al.
Publicado: (2025)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
por: Batlle-Roca, Roser, et al.
Publicado: (2024)
por: Batlle-Roca, Roser, et al.
Publicado: (2024)
A Survey of Foundation Models for Music Understanding
por: Li, Wenjun, et al.
Publicado: (2024)
por: Li, Wenjun, et al.
Publicado: (2024)
Efficient Fine-Grained Guidance for Diffusion Model Based Symbolic Music Generation
por: Zhu, Tingyu, et al.
Publicado: (2024)
por: Zhu, Tingyu, et al.
Publicado: (2024)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
por: Qian, Yikai, et al.
Publicado: (2024)
por: Qian, Yikai, et al.
Publicado: (2024)
ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence
por: Ma, Menghe, et al.
Publicado: (2026)
por: Ma, Menghe, et al.
Publicado: (2026)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
por: Zhao, Zijian, et al.
Publicado: (2025)
por: Zhao, Zijian, et al.
Publicado: (2025)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
por: Luo, Jing, et al.
Publicado: (2025)
por: Luo, Jing, et al.
Publicado: (2025)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
por: Choi, Suhwan, et al.
Publicado: (2025)
por: Choi, Suhwan, et al.
Publicado: (2025)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
por: Luo, Jing, et al.
Publicado: (2024)
por: Luo, Jing, et al.
Publicado: (2024)
Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation
por: Lam, Max W. Y., et al.
Publicado: (2025)
por: Lam, Max W. Y., et al.
Publicado: (2025)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
por: Zhang, Yixiao, et al.
Publicado: (2024)
por: Zhang, Yixiao, et al.
Publicado: (2024)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
por: Deng, Zihao, et al.
Publicado: (2023)
por: Deng, Zihao, et al.
Publicado: (2023)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
Structured Multi-Track Accompaniment Arrangement via Style Prior Modelling
por: Zhao, Jingwei, et al.
Publicado: (2023)
por: Zhao, Jingwei, et al.
Publicado: (2023)
CoComposer: LLM Multi-agent Collaborative Music Composition
por: Xing, Peiwen, et al.
Publicado: (2025)
por: Xing, Peiwen, et al.
Publicado: (2025)
From Sound to Sight: Towards AI-authored Music Videos
por: Vitasovic, Leo, et al.
Publicado: (2025)
por: Vitasovic, Leo, et al.
Publicado: (2025)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
por: Alonso-Jiménez, Pablo, et al.
Publicado: (2024)
por: Alonso-Jiménez, Pablo, et al.
Publicado: (2024)
MusRec: Zero-Shot Text-to-Music Editing via Rectified Flow and Diffusion Transformers
por: Boudaghi, Ali, et al.
Publicado: (2025)
por: Boudaghi, Ali, et al.
Publicado: (2025)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
por: Chen, Jinming, et al.
Publicado: (2025)
por: Chen, Jinming, et al.
Publicado: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
Ejemplares similares
-
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
por: Yao, Yao, et al.
Publicado: (2023) -
JEN-1 DreamStyler: Customized Musical Concept Learning via Pivotal Parameters Tuning
por: Chen, Boyu, et al.
Publicado: (2024) -
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
por: Zhang, Yixiao, et al.
Publicado: (2024) -
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
por: Wang, Jinting, et al.
Publicado: (2025) -
YuE: Scaling Open Foundation Models for Long-Form Music Generation
por: Yuan, Ruibin, et al.
Publicado: (2025)