Seconds-Aligned PCA-DAC Latent Diffusion for Symbolic-to-Audio Drum Rendering
Fuente:
arXiv
Salvato in:
| Autori principali: | Soiledis, Konstantinos, Papakostas, Maximos Kaliakatsos, Makris, Dimos, Tsamis, Konstantinos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs
di: Soiledis, Konstantinos, et al.
Pubblicazione: (2026)
di: Soiledis, Konstantinos, et al.
Pubblicazione: (2026)
Incorporating Structure and Chord Constraints in Symbolic Transformer-based Melodic Harmonization
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025)
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025)
Pay (Cross) Attention to the Melody: Curriculum Masking for Single-Encoder Melodic Harmonization
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2026)
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2026)
A Cold Diffusion Approach for Percussive Dereverberation
di: Makris, Dimos, et al.
Pubblicazione: (2026)
di: Makris, Dimos, et al.
Pubblicazione: (2026)
A Machine Learning Approach for MIDI to Guitar Tablature Conversion
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025)
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025)
Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
di: Prokopiou, Ioannis, et al.
Pubblicazione: (2026)
Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis
di: Cui, Shuyang, et al.
Pubblicazione: (2026)
di: Cui, Shuyang, et al.
Pubblicazione: (2026)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
DAC-JAX: A JAX Implementation of the Descript Audio Codec
di: Braun, David
Pubblicazione: (2024)
di: Braun, David
Pubblicazione: (2024)
Enhanced Automatic Drum Transcription via Drum Stem Source Separation
di: Riley, Xavier, et al.
Pubblicazione: (2025)
di: Riley, Xavier, et al.
Pubblicazione: (2025)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
PhraseVAE and PhraseLDM: Latent Diffusion for Full-Song Multitrack Symbolic Music Generation
di: Ou, Longshen, et al.
Pubblicazione: (2025)
di: Ou, Longshen, et al.
Pubblicazione: (2025)
Foley Control: Aligning a Frozen Latent Text-to-Audio Model to Video
di: Rowles, Ciara, et al.
Pubblicazione: (2025)
di: Rowles, Ciara, et al.
Pubblicazione: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
Fast Timing-Conditioned Latent Audio Diffusion
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
Low-Resource Guidance for Controllable Latent Audio Diffusion
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
di: Taheri, Termeh, et al.
Pubblicazione: (2025)
di: Taheri, Termeh, et al.
Pubblicazione: (2025)
Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance
di: Luong, Diep, et al.
Pubblicazione: (2025)
di: Luong, Diep, et al.
Pubblicazione: (2025)
Noise-to-Notes: Diffusion-based Generation and Refinement for Automatic Drum Transcription
di: Yeung, Michael, et al.
Pubblicazione: (2025)
di: Yeung, Michael, et al.
Pubblicazione: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Towards Realistic Synthetic Data for Automatic Drum Transcription
di: Melucci, Pierfrancesco, et al.
Pubblicazione: (2026)
di: Melucci, Pierfrancesco, et al.
Pubblicazione: (2026)
MaskBeat: Loopable Drum Beat Generation
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching
di: Liu, Fei, et al.
Pubblicazione: (2026)
di: Liu, Fei, et al.
Pubblicazione: (2026)
Toward Deep Drum Source Separation
di: Mezza, Alessandro Ilic, et al.
Pubblicazione: (2023)
di: Mezza, Alessandro Ilic, et al.
Pubblicazione: (2023)
Adversarial Representation Learning for Robust Privacy Preservation in Audio
di: Gharib, Shayan, et al.
Pubblicazione: (2023)
di: Gharib, Shayan, et al.
Pubblicazione: (2023)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Audio Super-Resolution with Latent Bridge Models
di: Li, Chang, et al.
Pubblicazione: (2025)
di: Li, Chang, et al.
Pubblicazione: (2025)
ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model
di: Heydari, Mojtaba, et al.
Pubblicazione: (2024)
di: Heydari, Mojtaba, et al.
Pubblicazione: (2024)
DOSE : Drum One-Shot Extraction from Music Mixture
di: Hwang, Suntae, et al.
Pubblicazione: (2025)
di: Hwang, Suntae, et al.
Pubblicazione: (2025)
Drum-to-Vocal Percussion Sound Conversion and Its Evaluation Methodology
di: Nobukawa, Rinka, et al.
Pubblicazione: (2025)
di: Nobukawa, Rinka, et al.
Pubblicazione: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
di: Xin, Detai, et al.
Pubblicazione: (2026)
di: Xin, Detai, et al.
Pubblicazione: (2026)
Latent Watermarking of Audio Generative Models
di: Roman, Robin San, et al.
Pubblicazione: (2024)
di: Roman, Robin San, et al.
Pubblicazione: (2024)
Exploring compressibility of transformer based text-to-music (TTM) models
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
di: Moschopoulos, Vasileios, et al.
Pubblicazione: (2024)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
Text Conditioned Symbolic Drumbeat Generation using Latent Diffusion Models
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
di: Jajoria, Pushkar, et al.
Pubblicazione: (2024)
Diffusion Reconstruction towards Generalizable Audio Deepfake Detection
di: Cheng, Bo, et al.
Pubblicazione: (2026)
di: Cheng, Bo, et al.
Pubblicazione: (2026)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
Representation Learning for Audio Privacy Preservation using Source Separation and Robust Adversarial Learning
di: Luong, Diep, et al.
Pubblicazione: (2023)
di: Luong, Diep, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs
di: Soiledis, Konstantinos, et al.
Pubblicazione: (2026) -
Incorporating Structure and Chord Constraints in Symbolic Transformer-based Melodic Harmonization
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025) -
Pay (Cross) Attention to the Melody: Curriculum Masking for Single-Encoder Melodic Harmonization
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2026) -
A Cold Diffusion Approach for Percussive Dereverberation
di: Makris, Dimos, et al.
Pubblicazione: (2026) -
A Machine Learning Approach for MIDI to Guitar Tablature Conversion
di: Kaliakatsos-Papakostas, Maximos, et al.
Pubblicazione: (2025)