Enregistré dans:
| Auteurs principaux: | Yamamoto, Kohei, Okusa, Kosuke |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.03637 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
par: Feng, Jiu, et autres
Publié: (2024)
par: Feng, Jiu, et autres
Publié: (2024)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
par: Chen, Wenxi, et autres
Publié: (2024)
par: Chen, Wenxi, et autres
Publié: (2024)
Synthesizer Sound Matching Using Audio Spectrogram Transformers
par: Bruford, Fred, et autres
Publié: (2024)
par: Bruford, Fred, et autres
Publié: (2024)
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
par: Ariyanti, Whenty, et autres
Publié: (2024)
par: Ariyanti, Whenty, et autres
Publié: (2024)
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
par: Bae, Sangmin, et autres
Publié: (2023)
par: Bae, Sangmin, et autres
Publié: (2023)
BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization
par: Kuang, Sheng, et autres
Publié: (2022)
par: Kuang, Sheng, et autres
Publié: (2022)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
par: Sinha, Anshuman, et autres
Publié: (2024)
par: Sinha, Anshuman, et autres
Publié: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
par: Yoshimura, Kosuke, et autres
Publié: (2026)
par: Yoshimura, Kosuke, et autres
Publié: (2026)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
par: Elias, Noel
Publié: (2024)
par: Elias, Noel
Publié: (2024)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
par: Işık, Atakan, et autres
Publié: (2025)
par: Işık, Atakan, et autres
Publié: (2025)
AMAuT: A Flexible and Efficient Multiview Audio Transformer Framework Trained from Scratch
par: Shao, Weichuang, et autres
Publié: (2025)
par: Shao, Weichuang, et autres
Publié: (2025)
LipsAM: Lipschitz-Continuous Amplitude Modifier for Audio Signal Processing and its Application to Plug-and-Play Dereverberation
par: Matsumoto, Kazuki, et autres
Publié: (2026)
par: Matsumoto, Kazuki, et autres
Publié: (2026)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
par: Heggan, Calum, et autres
Publié: (2024)
par: Heggan, Calum, et autres
Publié: (2024)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
Underwater Acoustic Target Recognition based on Smoothness-inducing Regularization and Spectrogram-based Data Augmentation
par: Xu, Ji, et autres
Publié: (2023)
par: Xu, Ji, et autres
Publié: (2023)
Training-Free Multimodal Guidance for Video to Audio Generation
par: Grassucci, Eleonora, et autres
Publié: (2025)
par: Grassucci, Eleonora, et autres
Publié: (2025)
Africa-Centric Self-Supervised Pre-Training for Multilingual Speech Representation in a Sub-Saharan Context
par: Caubrière, Antoine, et autres
Publié: (2024)
par: Caubrière, Antoine, et autres
Publié: (2024)
MARS: Sound Generation via Multi-Channel Autoregression on Spectrograms
par: Ristori, Eleonora, et autres
Publié: (2025)
par: Ristori, Eleonora, et autres
Publié: (2025)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
par: Wisnu, Dyah A. M. G., et autres
Publié: (2025)
par: Wisnu, Dyah A. M. G., et autres
Publié: (2025)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
par: Yoneyama, Reo, et autres
Publié: (2024)
par: Yoneyama, Reo, et autres
Publié: (2024)
Transformer Based Machine Fault Detection From Audio Input
par: Holla, Kiran Voderhobli
Publié: (2026)
par: Holla, Kiran Voderhobli
Publié: (2026)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
par: Bourdin, Yann, et autres
Publié: (2025)
par: Bourdin, Yann, et autres
Publié: (2025)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
par: Akaishi, Natsuki, et autres
Publié: (2026)
par: Akaishi, Natsuki, et autres
Publié: (2026)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
par: Park, Sangwook, et autres
Publié: (2021)
par: Park, Sangwook, et autres
Publié: (2021)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
par: Wu, Yanru, et autres
Publié: (2026)
par: Wu, Yanru, et autres
Publié: (2026)
FAST: Fast Audio Spectrogram Transformer
par: Naman, Anugunj, et autres
Publié: (2025)
par: Naman, Anugunj, et autres
Publié: (2025)
Masked Contrastive Pre-Training Improves Music Audio Key Detection
par: Yonay, Ori, et autres
Publié: (2026)
par: Yonay, Ori, et autres
Publié: (2026)
Self-Supervised Audio-Visual Soundscape Stylization
par: Li, Tingle, et autres
Publié: (2024)
par: Li, Tingle, et autres
Publié: (2024)
Property Neurons in Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
SKILL: Similarity-aware Knowledge distILLation for Speech Self-Supervised Learning
par: Zampierin, Luca, et autres
Publié: (2024)
par: Zampierin, Luca, et autres
Publié: (2024)
MT-SLVR: Multi-Task Self-Supervised Learning for Transformation In(Variant) Representations
par: Heggan, Calum, et autres
Publié: (2023)
par: Heggan, Calum, et autres
Publié: (2023)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
par: Xiao, Yixuan, et autres
Publié: (2026)
par: Xiao, Yixuan, et autres
Publié: (2026)
ADNAC: Audio Denoiser using Neural Audio Codec
par: Jimon, Daniel, et autres
Publié: (2025)
par: Jimon, Daniel, et autres
Publié: (2025)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
par: Shahzad, Sahibzada Adil, et autres
Publié: (2026)
Exploring Federated Self-Supervised Learning for General Purpose Audio Understanding
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2024)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
par: Wang, Chien-Chun, et autres
Publié: (2025)
par: Wang, Chien-Chun, et autres
Publié: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
par: Wu, Daiqing, et autres
Publié: (2026)
par: Wu, Daiqing, et autres
Publié: (2026)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
par: Tabassum, Afrina, et autres
Publié: (2024)
par: Tabassum, Afrina, et autres
Publié: (2024)
Compression Robust Synthetic Speech Detection Using Patched Spectrogram Transformer
par: Yadav, Amit Kumar Singh, et autres
Publié: (2024)
par: Yadav, Amit Kumar Singh, et autres
Publié: (2024)
Documents similaires
-
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
par: Feng, Jiu, et autres
Publié: (2024) -
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
par: Chen, Wenxi, et autres
Publié: (2024) -
Synthesizer Sound Matching Using Audio Spectrogram Transformers
par: Bruford, Fred, et autres
Publié: (2024) -
Abnormal Respiratory Sound Identification Using Audio-Spectrogram Vision Transformer
par: Ariyanti, Whenty, et autres
Publié: (2024) -
Patch-Mix Contrastive Learning with Audio Spectrogram Transformer on Respiratory Sound Classification
par: Bae, Sangmin, et autres
Publié: (2023)