An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | da Costa, Maurício do V. M., Moliner, Eloi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diffusion-Based Audio Inpainting
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
A Diffusion-Based Generative Equalizer for Music Restoration
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Similarity-Guided Diffusion for Long-Gap Music Inpainting
di: Turland, Sean, et al.
Pubblicazione: (2025)
di: Turland, Sean, et al.
Pubblicazione: (2025)
HRTF Estimation using a Score-based Prior
di: Thuillier, Etienne, et al.
Pubblicazione: (2024)
di: Thuillier, Etienne, et al.
Pubblicazione: (2024)
Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
BUDDy: Single-Channel Blind Unsupervised Dereverberation with Diffusion Models
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
di: Moliner, Eloi, et al.
Pubblicazione: (2024)
Unsupervised Blind Joint Dereverberation and Room Acoustics Estimation with Diffusion Models
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
di: Huang, Kuan-Po, et al.
Pubblicazione: (2025)
di: Huang, Kuan-Po, et al.
Pubblicazione: (2025)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
di: Gu, Yi, et al.
Pubblicazione: (2026)
di: Gu, Yi, et al.
Pubblicazione: (2026)
Automatic Music Mixing using a Generative Model of Effect Embeddings
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
di: Moliner, Eloi, et al.
Pubblicazione: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
di: Li, Junhui, et al.
Pubblicazione: (2024)
di: Li, Junhui, et al.
Pubblicazione: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
di: Zhang, Jisi, et al.
Pubblicazione: (2025)
Enhancing Generalization in Audio Deepfake Detection: A Neural Collapse based Sampling and Training Approach
di: Yousif, Mohammed, et al.
Pubblicazione: (2024)
di: Yousif, Mohammed, et al.
Pubblicazione: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
di: Wang, Junnuo
Pubblicazione: (2025)
di: Wang, Junnuo
Pubblicazione: (2025)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
Measuring Audio Prompt Adherence with Distribution-based Embedding Distances
di: Grachten, Maarten
Pubblicazione: (2024)
di: Grachten, Maarten
Pubblicazione: (2024)
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)
di: Li, Chenda, et al.
Pubblicazione: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
di: Mancusi, Michele, et al.
Pubblicazione: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Noise-to-mask Ratio Loss for Deep Neural Network based Audio Watermarking
di: Moritz, Martin, et al.
Pubblicazione: (2024)
di: Moritz, Martin, et al.
Pubblicazione: (2024)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
di: Xiao, Zhenyuan, et al.
Pubblicazione: (2024)
Audio-based Step-count Estimation for Running -- Windowing and Neural Network Baselines
di: Wagner, Philipp, et al.
Pubblicazione: (2024)
di: Wagner, Philipp, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Diffusion-Based Audio Inpainting
di: Moliner, Eloi, et al.
Pubblicazione: (2023) -
A Diffusion-Based Generative Equalizer for Music Restoration
di: Moliner, Eloi, et al.
Pubblicazione: (2024) -
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023) -
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
di: Moliner, Eloi, et al.
Pubblicazione: (2024) -
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)