AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Yamamoto, Kohei, Okusa, Kosuke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
por: Bruford, Fred, et al.
Publicado: (2024)
por: Bruford, Fred, et al.
Publicado: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
por: Ariyanti, Whenty, et al.
Publicado: (2024)
por: Ariyanti, Whenty, et al.
Publicado: (2024)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023)
por: Bae, Sangmin, et al.
Publicado: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
por: Sinha, Anshuman, et al.
Publicado: (2024)
por: Sinha, Anshuman, et al.
Publicado: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
por: Kuang, Sheng, et al.
Publicado: (2022)
por: Kuang, Sheng, et al.
Publicado: (2022)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
por: Elias, Noel
Publicado: (2024)
por: Elias, Noel
Publicado: (2024)
AMAuT: A Flexible and Efficient Multiview Audio Transformer Framework Trained from Scratch
por: Shao, Weichuang, et al.
Publicado: (2025)
por: Shao, Weichuang, et al.
Publicado: (2025)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
por: Işık, Atakan, et al.
Publicado: (2025)
por: Işık, Atakan, et al.
Publicado: (2025)
LipsAM: Lipschitz-Continuous Amplitude Modifier for Audio Signal Processing and its Application to Plug-and-Play Dereverberation
por: Matsumoto, Kazuki, et al.
Publicado: (2026)
por: Matsumoto, Kazuki, et al.
Publicado: (2026)
Training-Free Multimodal Guidance for Video to Audio Generation
por: Grassucci, Eleonora, et al.
Publicado: (2025)
por: Grassucci, Eleonora, et al.
Publicado: (2025)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
por: Heggan, Calum, et al.
Publicado: (2024)
por: Heggan, Calum, et al.
Publicado: (2024)
Underwater Acoustic Target Recognition based on Smoothness-inducing Regularization and Spectrogram-based Data Augmentation
por: Xu, Ji, et al.
Publicado: (2023)
por: Xu, Ji, et al.
Publicado: (2023)
Transformer Based Machine Fault Detection From Audio Input
por: Holla, Kiran Voderhobli
Publicado: (2026)
por: Holla, Kiran Voderhobli
Publicado: (2026)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
por: Bourdin, Yann, et al.
Publicado: (2025)
por: Bourdin, Yann, et al.
Publicado: (2025)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
por: Behera, Swarup Ranjan, et al.
Publicado: (2024)
por: Behera, Swarup Ranjan, et al.
Publicado: (2024)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
por: Ristori, Eleonora, et al.
Publicado: (2025)
por: Ristori, Eleonora, et al.
Publicado: (2025)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
por: Wu, Yanru, et al.
Publicado: (2026)
por: Wu, Yanru, et al.
Publicado: (2026)
Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context
por: Caubrière, Antoine, et al.
Publicado: (2024)
por: Caubrière, Antoine, et al.
Publicado: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
por: Park, Sangwook, et al.
Publicado: (2021)
por: Park, Sangwook, et al.
Publicado: (2021)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
por: Yoneyama, Reo, et al.
Publicado: (2024)
por: Yoneyama, Reo, et al.
Publicado: (2024)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
por: Akaishi, Natsuki, et al.
Publicado: (2026)
por: Akaishi, Natsuki, et al.
Publicado: (2026)
FAST: Fast Audio Spectrogram Transformer
por: Naman, Anugunj, et al.
Publicado: (2025)
por: Naman, Anugunj, et al.
Publicado: (2025)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
por: Xiao, Yixuan, et al.
Publicado: (2026)
por: Xiao, Yixuan, et al.
Publicado: (2026)
ADNAC: Audio Denoiser using Neural Audio Codec
por: Jimon, Daniel, et al.
Publicado: (2025)
por: Jimon, Daniel, et al.
Publicado: (2025)
MT-SLVR: Multi-Task Self-Supervised Learning for Transformation In(Variant) Representations
por: Heggan, Calum, et al.
Publicado: (2023)
por: Heggan, Calum, et al.
Publicado: (2023)
Masked Contrastive Pre-Training Improves Music Audio Key Detection
por: Yonay, Ori, et al.
Publicado: (2026)
por: Yonay, Ori, et al.
Publicado: (2026)
Property Neurons in Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
por: Wu, Daiqing, et al.
Publicado: (2026)
por: Wu, Daiqing, et al.
Publicado: (2026)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
por: Zampierin, Luca, et al.
Publicado: (2024)
por: Zampierin, Luca, et al.
Publicado: (2024)
voice2mode: Phonation Mode Classification in Singing using Self-Supervised Speech Models
por: Justus, Aju Ani, et al.
Publicado: (2026)
por: Justus, Aju Ani, et al.
Publicado: (2026)
Self-Supervised Audio-Visual Soundscape Stylization
por: Li, Tingle, et al.
Publicado: (2024)
por: Li, Tingle, et al.
Publicado: (2024)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
por: Wang, Chien-Chun, et al.
Publicado: (2025)
por: Wang, Chien-Chun, et al.
Publicado: (2025)
Virtual Consistency for Audio Editing
por: Cervera, Matthieu, et al.
Publicado: (2025)
por: Cervera, Matthieu, et al.
Publicado: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
por: Tabassum, Afrina, et al.
Publicado: (2024)
por: Tabassum, Afrina, et al.
Publicado: (2024)
Segmentwise Pruning in Audio-Language Models
por: Gibier, Marcel, et al.
Publicado: (2025)
por: Gibier, Marcel, et al.
Publicado: (2025)
Ejemplares similares
-
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024) -
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
por: Chen, Wenxi, et al.
Publicado: (2024) -
Synthesizer Sound Matching Using Audio Spectrogram Transformers
por: Bruford, Fred, et al.
Publicado: (2024) -
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
por: Ariyanti, Whenty, et al.
Publicado: (2024) -
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
por: Bae, Sangmin, et al.
Publicado: (2023)