From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Jiu, Erol, Mehmet Hamza, Chung, Joon Son, Senocak, Arda |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Cinematic Audio Source Separation Using Visual Cues
di: Zhang, Kang, et al.
Pubblicazione: (2026)
di: Zhang, Kang, et al.
Pubblicazione: (2026)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
di: Bruford, Fred, et al.
Pubblicazione: (2024)
di: Bruford, Fred, et al.
Pubblicazione: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
di: Ariyanti, Whenty, et al.
Pubblicazione: (2024)
di: Ariyanti, Whenty, et al.
Pubblicazione: (2024)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
di: Zhang, Kang, et al.
Pubblicazione: (2025)
di: Zhang, Kang, et al.
Pubblicazione: (2025)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
di: Elias, Noel
Pubblicazione: (2024)
di: Elias, Noel
Pubblicazione: (2024)
Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
di: Zhang, Hengfan, et al.
Pubblicazione: (2026)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
di: Pham, The Hieu, et al.
Pubblicazione: (2025)
di: Pham, The Hieu, et al.
Pubblicazione: (2025)
FAST: Fast Audio Spectrogram Transformer
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
di: Senocak, Arda, et al.
Pubblicazione: (2024)
di: Senocak, Arda, et al.
Pubblicazione: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
di: Işık, Atakan, et al.
Pubblicazione: (2025)
di: Işık, Atakan, et al.
Pubblicazione: (2025)
ASM: Audio Spectrogram Mixer
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
di: Vora, Jayneel, et al.
Pubblicazione: (2024)
di: Vora, Jayneel, et al.
Pubblicazione: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
di: Comunità, Marco, et al.
Pubblicazione: (2024)
di: Comunità, Marco, et al.
Pubblicazione: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
di: Dehaghania, Parinaz Binandeh, et al.
Pubblicazione: (2026)
di: Dehaghania, Parinaz Binandeh, et al.
Pubblicazione: (2026)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
Voice-Driven Mortality Prediction in Hospitalized Heart Failure Patients: A Machine Learning Approach Enhanced with Diagnostic Biomarkers
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
di: Park, Sangwook, et al.
Pubblicazione: (2021)
di: Park, Sangwook, et al.
Pubblicazione: (2021)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
di: Khodzhaev, Zulfidin
Pubblicazione: (2024)
di: Khodzhaev, Zulfidin
Pubblicazione: (2024)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Hearing Your Blood Sugar: Non-Invasive Glucose Measurement Through Simple Vocal Signals, Transforming any Speech into a Sensor with Machine Learning
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
di: Ahmadli, Nihat, et al.
Pubblicazione: (2024)
Transformer Redesign for Late Fusion of Audio-Text Features on Ultra-Low-Power Edge Hardware
di: Mitsis, Stavros, et al.
Pubblicazione: (2025)
di: Mitsis, Stavros, et al.
Pubblicazione: (2025)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
di: Cerovaz, Luca, et al.
Pubblicazione: (2026)
di: Cerovaz, Luca, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
di: Feng, Jiu, et al.
Pubblicazione: (2024) -
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024) -
Cinematic Audio Source Separation Using Visual Cues
di: Zhang, Kang, et al.
Pubblicazione: (2026) -
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025) -
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
di: Bae, Sangmin, et al.
Pubblicazione: (2023)