Efficient Fine-tuning of Audio Spectrogram Transformers via Soft Mixture of Adapters
Fuente:
arXiv
Salvato in:
| Autori principali: | Cappellazzo, Umberto, Falavigna, Daniele, Brutti, Alessio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Parameter-Efficient Transfer Learning of Audio Spectrogram Transformers
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023)
Continual Contrastive Spoken Language Understanding
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023)
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
Input Conditioned Layer Dropping in Speech Foundation Models
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
di: Hannan, Abdul, et al.
Pubblicazione: (2025)
Training dynamic models using early exits for automatic speech recognition on resource-constrained devices
di: Wright, George August, et al.
Pubblicazione: (2023)
di: Wright, George August, et al.
Pubblicazione: (2023)
Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages
di: Fong, Seraphina, et al.
Pubblicazione: (2025)
di: Fong, Seraphina, et al.
Pubblicazione: (2025)
Learning Temporal Resolution in Spectrogram for Audio Classification
di: Liu, Haohe, et al.
Pubblicazione: (2022)
di: Liu, Haohe, et al.
Pubblicazione: (2022)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
di: Pham, Lam, et al.
Pubblicazione: (2024)
di: Pham, Lam, et al.
Pubblicazione: (2024)
Evaluating and Improving Continual Learning in Spoken Language Understanding
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
di: Yang, Muqiao, et al.
Pubblicazione: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
di: Feng, Jiu, et al.
Pubblicazione: (2024)
di: Feng, Jiu, et al.
Pubblicazione: (2024)
A Survey of Deep Learning for Complex Speech Spectrograms
di: Xie, Yuying, et al.
Pubblicazione: (2025)
di: Xie, Yuying, et al.
Pubblicazione: (2025)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
di: Wen, Penghui, et al.
Pubblicazione: (2023)
di: Wen, Penghui, et al.
Pubblicazione: (2023)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
di: Işık, Atakan, et al.
Pubblicazione: (2025)
di: Işık, Atakan, et al.
Pubblicazione: (2025)
FAST: Fast Audio Spectrogram Transformer
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2025)
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
di: Wang, Yang, et al.
Pubblicazione: (2023)
di: Wang, Yang, et al.
Pubblicazione: (2023)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2026)
MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free
di: Lei, Yishu, et al.
Pubblicazione: (2026)
di: Lei, Yishu, et al.
Pubblicazione: (2026)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Detection of manatee vocalisations using the Audio Spectrogram Transformer
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
di: Schiappacasse, Stefano, et al.
Pubblicazione: (2024)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024)
di: Qiu, Kai, et al.
Pubblicazione: (2024)
ESPnet-EZ: Python-only ESPnet for Easy Fine-tuning and Integration
di: Someki, Masao, et al.
Pubblicazione: (2024)
di: Someki, Masao, et al.
Pubblicazione: (2024)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Shao, Nian, et al.
Pubblicazione: (2025)
di: Shao, Nian, et al.
Pubblicazione: (2025)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
Improving Anomalous Sound Detection via Low-Rank Adaptation Fine-Tuning of Pre-Trained Audio Models
di: Zheng, Xinhu, et al.
Pubblicazione: (2024)
di: Zheng, Xinhu, et al.
Pubblicazione: (2024)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2024)
Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
di: Zhao, Xufang, et al.
Pubblicazione: (2025)
di: Zhao, Xufang, et al.
Pubblicazione: (2025)
Spectrogram features for audio and speech analysis
di: McLoughlin, Ian, et al.
Pubblicazione: (2026)
di: McLoughlin, Ian, et al.
Pubblicazione: (2026)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
ASM: Audio Spectrogram Mixer
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Parameter-Efficient Transfer Learning of Audio Spectrogram Transformers
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023) -
Continual Contrastive Spoken Language Understanding
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2023) -
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025) -
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024) -
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)