Saved in:
Bibliographic Details
Main Authors: da Costa, Maurício do V. M., Moliner, Eloi
Format: Preprint
Published: 2025
Subjects:
Online Access:https://arxiv.org/abs/2509.16603
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909798514032640
author da Costa, Maurício do V. M.
Moliner, Eloi
author_facet da Costa, Maurício do V. M.
Moliner, Eloi
contents This paper introduces MR-CQTdiff, a novel neural-network architecture for diffusion-based audio generation that leverages a multi-resolution Constant-$Q$ Transform (C$Q$T). The proposed architecture employs an efficient, invertible CQT framework that adjusts the time-frequency resolution on an octave-by-octave basis. This design addresses the issue of low temporal resolution at lower frequencies, enabling more flexible and expressive audio generation. We conduct an evaluation using the Fréchet Audio Distance (FAD) metric across various architectures and two datasets. Experimental results demonstrate that MR-CQTdiff achieves state-of-the-art audio quality, outperforming competing architectures.
format Preprint
id arxiv_https___arxiv_org_abs_2509_16603
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
da Costa, Maurício do V. M.
Moliner, Eloi
Audio and Speech Processing
Sound
This paper introduces MR-CQTdiff, a novel neural-network architecture for diffusion-based audio generation that leverages a multi-resolution Constant-$Q$ Transform (C$Q$T). The proposed architecture employs an efficient, invertible CQT framework that adjusts the time-frequency resolution on an octave-by-octave basis. This design addresses the issue of low temporal resolution at lower frequencies, enabling more flexible and expressive audio generation. We conduct an evaluation using the Fréchet Audio Distance (FAD) metric across various architectures and two datasets. Experimental results demonstrate that MR-CQTdiff achieves state-of-the-art audio quality, outperforming competing architectures.
title An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
topic Audio and Speech Processing
Sound
url https://arxiv.org/abs/2509.16603