SAMUeL: Efficient Vocal-Conditioned Music Generation via Soft Alignment Attention and Latent Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheung, Hei Shing, Zhang, Boya, Chan, Jonathan H. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model
di: Taksuka, Shinnosuke, et al.
Pubblicazione: (2026)
di: Taksuka, Shinnosuke, et al.
Pubblicazione: (2026)
Multi-Source Music Generation with Latent Diffusion
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2024)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2024)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction
di: Chae, Yunkee, et al.
Pubblicazione: (2025)
di: Chae, Yunkee, et al.
Pubblicazione: (2025)
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
Fast Timing-Conditioned Latent Audio Diffusion
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
di: Postolache, Emilian, et al.
Pubblicazione: (2024)
Hierarchical Generative Modeling of Melodic Vocal Contours in Hindustani Classical Music
di: Shikarpur, Nithya, et al.
Pubblicazione: (2024)
di: Shikarpur, Nithya, et al.
Pubblicazione: (2024)
ProGress: Structured Music Generation via Graph Diffusion and Hierarchical Music Analysis
di: Ni-Hahn, Stephen, et al.
Pubblicazione: (2025)
di: Ni-Hahn, Stephen, et al.
Pubblicazione: (2025)
Bass Accompaniment Generation via Latent Diffusion
di: Pasini, Marco, et al.
Pubblicazione: (2024)
di: Pasini, Marco, et al.
Pubblicazione: (2024)
Subtractive Training for Music Stem Insertion using Latent Diffusion Models
di: Villa-Renteria, Ivan, et al.
Pubblicazione: (2024)
di: Villa-Renteria, Ivan, et al.
Pubblicazione: (2024)
Count The Notes: Histogram-Based Supervision for Automatic Music Transcription
di: Yaffe, Jonathan, et al.
Pubblicazione: (2025)
di: Yaffe, Jonathan, et al.
Pubblicazione: (2025)
Machine Learning Approaches to Vocal Register Classification in Contemporary Male Pop Music
di: Kim, Alexander, et al.
Pubblicazione: (2025)
di: Kim, Alexander, et al.
Pubblicazione: (2025)
Benchmarking Music Generation Models and Metrics via Human Preference Studies
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
di: Grötschla, Florian, et al.
Pubblicazione: (2025)
A Dataset for Automatic Vocal Mode Classification
di: Hinrichs, Reemt, et al.
Pubblicazione: (2026)
di: Hinrichs, Reemt, et al.
Pubblicazione: (2026)
Generating Music with Structure Using Self-Similarity as Attention
di: Hager, Sophia, et al.
Pubblicazione: (2024)
di: Hager, Sophia, et al.
Pubblicazione: (2024)
Recognizing Ornaments in Vocal Indian Art Music with Active Annotation
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
di: Kumar, Sumit, et al.
Pubblicazione: (2025)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
di: Pasini, Marco, et al.
Pubblicazione: (2024)
di: Pasini, Marco, et al.
Pubblicazione: (2024)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
Symbolic Music Generation with Non-Differentiable Rule Guided Diffusion
di: Huang, Yujia, et al.
Pubblicazione: (2024)
di: Huang, Yujia, et al.
Pubblicazione: (2024)
LiLAC: A Lightweight Latent ControlNet for Musical Audio Generation
di: Baker, Tom, et al.
Pubblicazione: (2025)
di: Baker, Tom, et al.
Pubblicazione: (2025)
DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music Generation
di: Novack, Zachary, et al.
Pubblicazione: (2024)
di: Novack, Zachary, et al.
Pubblicazione: (2024)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
di: Jiang, Ziyue, et al.
Pubblicazione: (2025)
Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
WhAM: Towards A Translative Model of Sperm Whale Vocalization
di: Paradise, Orr, et al.
Pubblicazione: (2025)
di: Paradise, Orr, et al.
Pubblicazione: (2025)
VocalBridge: Latent Diffusion-Bridge Purification for Defeating Perturbation-Based Voiceprint Defenses
di: Abbasihafshejani, Maryam, et al.
Pubblicazione: (2026)
di: Abbasihafshejani, Maryam, et al.
Pubblicazione: (2026)
Depth-Structured Music Recurrence: Budgeted Recurrent Attention for Full-Piece Symbolic Music Modeling
di: Yi, Yungang, et al.
Pubblicazione: (2026)
di: Yi, Yungang, et al.
Pubblicazione: (2026)
Fusing Memory and Attention: A study on LSTM, Transformer and Hybrid Architectures for Symbolic Music Generation
di: Ghoshal, Soudeep, et al.
Pubblicazione: (2026)
di: Ghoshal, Soudeep, et al.
Pubblicazione: (2026)
Rethinking Music Captioning with Music Metadata LLMs
di: Bukey, Irmak, et al.
Pubblicazione: (2026)
di: Bukey, Irmak, et al.
Pubblicazione: (2026)
MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control
di: Kumar, Sahil, et al.
Pubblicazione: (2026)
di: Kumar, Sahil, et al.
Pubblicazione: (2026)
Bias beyond Borders: Global Inequalities in AI-Generated Music
di: Solak, Ahmet, et al.
Pubblicazione: (2025)
di: Solak, Ahmet, et al.
Pubblicazione: (2025)
Multi-Source Diffusion Models for Simultaneous Music Generation and Separation
di: Mariani, Giorgio, et al.
Pubblicazione: (2023)
di: Mariani, Giorgio, et al.
Pubblicazione: (2023)
A Real-Time Lyrics Alignment System Using Chroma And Phonetic Features For Classical Vocal Performance
di: Park, Jiyun, et al.
Pubblicazione: (2024)
di: Park, Jiyun, et al.
Pubblicazione: (2024)
Generating Separated Singing Vocals Using a Diffusion Model Conditioned on Music Mixtures
di: Plaja-Roglans, Genís, et al.
Pubblicazione: (2025)
di: Plaja-Roglans, Genís, et al.
Pubblicazione: (2025)
Vocal Prognostic Digital Biomarkers in Monitoring Chronic Heart Failure: A Longitudinal Observational Study
di: Wu, Fan, et al.
Pubblicazione: (2026)
di: Wu, Fan, et al.
Pubblicazione: (2026)
Online Symbolic Music Alignment with Offline Reinforcement Learning
di: Peter, Silvan David
Pubblicazione: (2023)
di: Peter, Silvan David
Pubblicazione: (2023)
Of All StrIPEs: Investigating Structure-informed Positional Encoding for Efficient Music Generation
di: Agarwal, Manvi, et al.
Pubblicazione: (2025)
di: Agarwal, Manvi, et al.
Pubblicazione: (2025)
Detecting Musical Deepfakes
di: Sunday, Nick
Pubblicazione: (2025)
di: Sunday, Nick
Pubblicazione: (2025)
Sound and Music Biases in Deep Music Transcription Models: A Systematic Analysis
di: Marták, Lukáš Samuel, et al.
Pubblicazione: (2025)
di: Marták, Lukáš Samuel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model
di: Taksuka, Shinnosuke, et al.
Pubblicazione: (2026) -
Multi-Source Music Generation with Latent Diffusion
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2024) -
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
di: Yang, Yudong, et al.
Pubblicazione: (2024) -
MGE-LDM: Joint Latent Diffusion for Simultaneous Music Generation and Source Extraction
di: Chae, Yunkee, et al.
Pubblicazione: (2025) -
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
di: Postolache, Emilian, et al.
Pubblicazione: (2024)