Post-Training Quantization for Audio Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Khandelwal, Tanmay, Fuentes, Magdalena |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
par: Vora, Jayneel, et autres
Publié: (2024)
par: Vora, Jayneel, et autres
Publié: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
par: Wilkins, Julia, et autres
Publié: (2024)
par: Wilkins, Julia, et autres
Publié: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)
par: Jia, Yuhang, et autres
Publié: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
par: Namballa, Richa, et autres
Publié: (2025)
par: Namballa, Richa, et autres
Publié: (2025)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
par: Schmid, Florian, et autres
Publié: (2024)
par: Schmid, Florian, et autres
Publié: (2024)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
par: Wang, Junnuo
Publié: (2025)
par: Wang, Junnuo
Publié: (2025)
Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation
par: Gu, Yi, et autres
Publié: (2026)
par: Gu, Yi, et autres
Publié: (2026)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
par: Chen, Yushen, et autres
Publié: (2025)
par: Chen, Yushen, et autres
Publié: (2025)
Diffusion-Based Audio Inpainting
par: Moliner, Eloi, et autres
Publié: (2023)
par: Moliner, Eloi, et autres
Publié: (2023)
Can Quantized Audio Language Models Perform Zero-Shot Spoofing Detection?
par: Dutta, Bikash, et autres
Publié: (2025)
par: Dutta, Bikash, et autres
Publié: (2025)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
par: Wang, Jin, et autres
Publié: (2025)
par: Wang, Jin, et autres
Publié: (2025)
Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification
par: Acevedo, Emiliano, et autres
Publié: (2025)
par: Acevedo, Emiliano, et autres
Publié: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
FAST: Fast Audio Spectrogram Transformer
par: Naman, Anugunj, et autres
Publié: (2025)
par: Naman, Anugunj, et autres
Publié: (2025)
ProLAP: Probabilistic Language-Audio Pre-Training
par: Manabe, Toranosuke, et autres
Publié: (2025)
par: Manabe, Toranosuke, et autres
Publié: (2025)
Deep Audio Watermarks are Shallow: Limitations of Post-Hoc Watermarking Techniques for Speech
par: O'Reilly, Patrick, et autres
Publié: (2025)
par: O'Reilly, Patrick, et autres
Publié: (2025)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024)
par: Fang, Yuan, et autres
Publié: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
par: Sinha, Anshuman, et autres
Publié: (2024)
par: Sinha, Anshuman, et autres
Publié: (2024)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
par: Shi, Runwu, et autres
Publié: (2025)
par: Shi, Runwu, et autres
Publié: (2025)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
par: Selvaraj, Nithish Muthuchamy, et autres
Publié: (2023)
DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset
par: Du, Jiawei, et autres
Publié: (2024)
par: Du, Jiawei, et autres
Publié: (2024)
Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning
par: Wilkins, Julia, et autres
Publié: (2025)
par: Wilkins, Julia, et autres
Publié: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
par: Chaudhuri, Yashwardhan, et autres
Publié: (2024)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
par: Gu, Yuzhe, et autres
Publié: (2024)
par: Gu, Yuzhe, et autres
Publié: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization
par: Zhang, Xiangyu, et autres
Publié: (2026)
par: Zhang, Xiangyu, et autres
Publié: (2026)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
par: da Costa, Maurício do V. M., et autres
Publié: (2025)
par: da Costa, Maurício do V. M., et autres
Publié: (2025)
Diff-SAGe: End-to-End Spatial Audio Generation Using Diffusion Models
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
par: Kushwaha, Saksham Singh, et autres
Publié: (2024)
Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training
par: Udupa, Sathvik, et autres
Publié: (2025)
par: Udupa, Sathvik, et autres
Publié: (2025)
Documents similaires
-
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
par: Vora, Jayneel, et autres
Publié: (2024) -
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024) -
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
par: Wilkins, Julia, et autres
Publié: (2024) -
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024) -
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
par: Jia, Yuhang, et autres
Publié: (2024)