AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Yamamoto, Kohei, Okusa, Kosuke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
di: Bruford, Fred, et al.
Pubblicazione: (2024)
di: Bruford, Fred, et al.
Pubblicazione: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
di: Ariyanti, Whenty, et al.
Pubblicazione: (2024)
di: Ariyanti, Whenty, et al.
Pubblicazione: (2024)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
di: Bae, Sangmin, et al.
Pubblicazione: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
di: Yoshimura, Kosuke, et al.
Pubblicazione: (2026)
di: Yoshimura, Kosuke, et al.
Pubblicazione: (2026)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
di: Kuang, Sheng, et al.
Pubblicazione: (2022)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
di: Elias, Noel
Pubblicazione: (2024)
di: Elias, Noel
Pubblicazione: (2024)
AMAuT: A Flexible and Efficient Multiview Audio Transformer Framework Trained from Scratch
di: Shao, Weichuang, et al.
Pubblicazione: (2025)
di: Shao, Weichuang, et al.
Pubblicazione: (2025)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
di: Işık, Atakan, et al.
Pubblicazione: (2025)
di: Işık, Atakan, et al.
Pubblicazione: (2025)
LipsAM: Lipschitz-Continuous Amplitude Modifier for Audio Signal Processing and its Application to Plug-and-Play Dereverberation
di: Matsumoto, Kazuki, et al.
Pubblicazione: (2026)
di: Matsumoto, Kazuki, et al.
Pubblicazione: (2026)
Training-Free Multimodal Guidance for Video to Audio Generation
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2025)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
di: Heggan, Calum, et al.
Pubblicazione: (2024)
di: Heggan, Calum, et al.
Pubblicazione: (2024)
Underwater Acoustic Target Recognition based on Smoothness-inducing Regularization and Spectrogram-based Data Augmentation
di: Xu, Ji, et al.
Pubblicazione: (2023)
di: Xu, Ji, et al.
Pubblicazione: (2023)
Transformer Based Machine Fault Detection From Audio Input
di: Holla, Kiran Voderhobli
Pubblicazione: (2026)
di: Holla, Kiran Voderhobli
Pubblicazione: (2026)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
di: Bourdin, Yann, et al.
Pubblicazione: (2025)
di: Bourdin, Yann, et al.
Pubblicazione: (2025)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
di: Ristori, Eleonora, et al.
Pubblicazione: (2025)
di: Ristori, Eleonora, et al.
Pubblicazione: (2025)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
di: Wisnu, Dyah A. M. G., et al.
Pubblicazione: (2025)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
di: Wu, Yanru, et al.
Pubblicazione: (2026)
di: Wu, Yanru, et al.
Pubblicazione: (2026)
Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context
di: Caubrière, Antoine, et al.
Pubblicazione: (2024)
di: Caubrière, Antoine, et al.
Pubblicazione: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
di: Park, Sangwook, et al.
Pubblicazione: (2021)
di: Park, Sangwook, et al.
Pubblicazione: (2021)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
di: Akaishi, Natsuki, et al.
Pubblicazione: (2026)
di: Akaishi, Natsuki, et al.
Pubblicazione: (2026)
FAST: Fast Audio Spectrogram Transformer
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
di: Alex, Tony, et al.
Pubblicazione: (2025)
di: Alex, Tony, et al.
Pubblicazione: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
di: Xiao, Yixuan, et al.
Pubblicazione: (2026)
ADNAC: Audio Denoiser using Neural Audio Codec
di: Jimon, Daniel, et al.
Pubblicazione: (2025)
di: Jimon, Daniel, et al.
Pubblicazione: (2025)
MT-SLVR: Multi-Task Self-Supervised Learning for Transformation In(Variant) Representations
di: Heggan, Calum, et al.
Pubblicazione: (2023)
di: Heggan, Calum, et al.
Pubblicazione: (2023)
Masked Contrastive Pre-Training Improves Music Audio Key Detection
di: Yonay, Ori, et al.
Pubblicazione: (2026)
di: Yonay, Ori, et al.
Pubblicazione: (2026)
Property Neurons in Self-Supervised Speech Transformers
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2024)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
di: Wu, Daiqing, et al.
Pubblicazione: (2026)
di: Wu, Daiqing, et al.
Pubblicazione: (2026)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
di: Zampierin, Luca, et al.
Pubblicazione: (2024)
voice2mode: Phonation Mode Classification in Singing using Self-Supervised Speech Models
di: Justus, Aju Ani, et al.
Pubblicazione: (2026)
di: Justus, Aju Ani, et al.
Pubblicazione: (2026)
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
Virtual Consistency for Audio Editing
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Segmentwise Pruning in Audio-Language Models
di: Gibier, Marcel, et al.
Pubblicazione: (2025)
di: Gibier, Marcel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
di: Feng, Jiu, et al.
Pubblicazione: (2024) -
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
di: Chen, Wenxi, et al.
Pubblicazione: (2024) -
Synthesizer Sound Matching Using Audio Spectrogram Transformers
di: Bruford, Fred, et al.
Pubblicazione: (2024) -
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
di: Ariyanti, Whenty, et al.
Pubblicazione: (2024) -
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
di: Bae, Sangmin, et al.
Pubblicazione: (2023)