An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | da Costa, Maurício do V. M., Moliner, Eloi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diffusion-Based Audio Inpainting
par: Moliner, Eloi, et autres
Publié: (2023)
par: Moliner, Eloi, et autres
Publié: (2023)
A Diffusion-Based Generative Equalizer for Music Restoration
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
par: Moliner, Eloi, et autres
Publié: (2023)
par: Moliner, Eloi, et autres
Publié: (2023)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
Diffusion Models for Audio Restoration
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
Similarity-Guided Diffusion for Long-Gap Music Inpainting
par: Turland, Sean, et autres
Publié: (2025)
par: Turland, Sean, et autres
Publié: (2025)
HRTF Estimation using a Score-based Prior
par: Thuillier, Etienne, et autres
Publié: (2024)
par: Thuillier, Etienne, et autres
Publié: (2024)
Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations
par: Murgul, Sebastian, et autres
Publié: (2025)
par: Murgul, Sebastian, et autres
Publié: (2025)
BUDDy: Single-Channel Blind Unsupervised Dereverberation with Diffusion Models
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
Unsupervised Blind Joint Dereverberation and Room Acoustics Estimation with Diffusion Models
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling
par: Huang, Kuan-Po, et autres
Publié: (2025)
par: Huang, Kuan-Po, et autres
Publié: (2025)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
par: Gu, Yi, et autres
Publié: (2026)
par: Gu, Yi, et autres
Publié: (2026)
Automatic Music Mixing using a Generative Model of Effect Embeddings
par: Moliner, Eloi, et autres
Publié: (2025)
par: Moliner, Eloi, et autres
Publié: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
par: Zhang, Jisi, et autres
Publié: (2025)
par: Zhang, Jisi, et autres
Publié: (2025)
Enhancing Generalization in Audio Deepfake Detection: A Neural Collapse based Sampling and Training Approach
par: Yousif, Mohammed, et autres
Publié: (2024)
par: Yousif, Mohammed, et autres
Publié: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
par: Xin, Yifei, et autres
Publié: (2024)
par: Xin, Yifei, et autres
Publié: (2024)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
par: Wang, Junnuo
Publié: (2025)
par: Wang, Junnuo
Publié: (2025)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
par: Xu, Xuenan, et autres
Publié: (2023)
par: Xu, Xuenan, et autres
Publié: (2023)
Measuring Audio Prompt Adherence with Distribution-based Embedding Distances
par: Grachten, Maarten
Publié: (2024)
par: Grachten, Maarten
Publié: (2024)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
par: Li, Chenda, et autres
Publié: (2024)
par: Li, Chenda, et autres
Publié: (2024)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
par: Li, Chenxing, et autres
Publié: (2024)
par: Li, Chenxing, et autres
Publié: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
par: Yamamoto, Katsuhiko, et autres
Publié: (2025)
par: Yamamoto, Katsuhiko, et autres
Publié: (2025)
Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer
par: Mancusi, Michele, et autres
Publié: (2024)
par: Mancusi, Michele, et autres
Publié: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Noise-to-mask Ratio Loss for Deep Neural Network based Audio Watermarking
par: Moritz, Martin, et autres
Publié: (2024)
par: Moritz, Martin, et autres
Publié: (2024)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024)
par: Xiao, Zhenyuan, et autres
Publié: (2024)
Audio-based Step-count Estimation for Running -- Windowing and Neural Network Baselines
par: Wagner, Philipp, et autres
Publié: (2024)
par: Wagner, Philipp, et autres
Publié: (2024)
Documents similaires
-
Diffusion-Based Audio Inpainting
par: Moliner, Eloi, et autres
Publié: (2023) -
A Diffusion-Based Generative Equalizer for Music Restoration
par: Moliner, Eloi, et autres
Publié: (2024) -
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
par: Moliner, Eloi, et autres
Publié: (2023) -
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
par: Moliner, Eloi, et autres
Publié: (2024) -
Diffusion Models for Audio Restoration
par: Lemercier, Jean-Marie, et autres
Publié: (2024)