FAST: Fast Audio Spectrogram Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Naman, Anugunj, Zhang, Gaibo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ASM: Audio Spectrogram Mixer
por: Ji, Qingfeng, et al.
Publicado: (2024)
por: Ji, Qingfeng, et al.
Publicado: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
por: Khodzhaev, Zulfidin
Publicado: (2024)
por: Khodzhaev, Zulfidin
Publicado: (2024)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
por: Bruford, Fred, et al.
Publicado: (2024)
por: Bruford, Fred, et al.
Publicado: (2024)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
por: Comunità, Marco, et al.
Publicado: (2024)
por: Comunità, Marco, et al.
Publicado: (2024)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
por: Ariyanti, Whenty, et al.
Publicado: (2024)
por: Ariyanti, Whenty, et al.
Publicado: (2024)
Distilling Spectrograms into Tokens: Fast and Lightweight Bioacoustic Classification for BirdCLEF+ 2025
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023)
por: Bae, Sangmin, et al.
Publicado: (2023)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024)
por: Guo, Hongming, et al.
Publicado: (2024)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
por: Akaishi, Natsuki, et al.
Publicado: (2026)
por: Akaishi, Natsuki, et al.
Publicado: (2026)
Hybrid Audio Detection Using Fine-Tuned Audio Spectrogram Transformers: A Dataset-Driven Evaluation of Mixed AI-Human Speech
por: Huang, Kunyang, et al.
Publicado: (2025)
por: Huang, Kunyang, et al.
Publicado: (2025)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
por: Elias, Noel
Publicado: (2024)
por: Elias, Noel
Publicado: (2024)
Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
por: Gogoi, Parismita, et al.
Publicado: (2025)
por: Gogoi, Parismita, et al.
Publicado: (2025)
Comparison Performance of Spectrogram and Scalogram as Input of Acoustic Recognition Task
por: Phan, Dang Thoai
Publicado: (2024)
por: Phan, Dang Thoai
Publicado: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
por: Li, Junhui, et al.
Publicado: (2024)
por: Li, Junhui, et al.
Publicado: (2024)
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Learning Temporal Resolution in Spectrogram for Audio Classification
por: Liu, Haohe, et al.
Publicado: (2022)
por: Liu, Haohe, et al.
Publicado: (2022)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
por: Atito, Sara, et al.
Publicado: (2022)
por: Atito, Sara, et al.
Publicado: (2022)
Post-Training Quantization for Audio Diffusion Transformers
por: Khandelwal, Tanmay, et al.
Publicado: (2025)
por: Khandelwal, Tanmay, et al.
Publicado: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
por: Sang, Wendi, et al.
Publicado: (2025)
por: Sang, Wendi, et al.
Publicado: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025)
por: Yang, Runxuan, et al.
Publicado: (2025)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
por: Wen, Penghui, et al.
Publicado: (2023)
por: Wen, Penghui, et al.
Publicado: (2023)
Continuous Learning of Transformer-based Audio Deepfake Detection
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
por: Le, Tuan Duy Nguyen, et al.
Publicado: (2024)
SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models
por: Pozorski, Paweł, et al.
Publicado: (2026)
por: Pozorski, Paweł, et al.
Publicado: (2026)
Effective Pre-Training of Audio Transformers for Sound Event Detection
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
Ejemplares similares
-
ASM: Audio Spectrogram Mixer
por: Ji, Qingfeng, et al.
Publicado: (2024) -
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023) -
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024) -
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026) -
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)