Effective Pre-Training of Audio Transformers for Sound Event Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Schmid, Florian, Morocutti, Tobias, Foscarin, Francesco, Schlüter, Jan, Primus, Paul, Widmer, Gerhard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Exploring Performance-Complexity Trade-Offs in Sound Event Detection Models
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Multi-Iteration Multi-Stage Fine-Tuning of Transformers for Sound Event Detection with Heterogeneous Datasets
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Beat this! Accurate beat tracking without DBN postprocessing
di: Foscarin, Francesco, et al.
Pubblicazione: (2024)
di: Foscarin, Francesco, et al.
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Creating a Good Teacher for Knowledge Distillation in Acoustic Scene Classification
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
SMUG-Explain: A Framework for Symbolic Music Graph Explanations
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
Device-Robust Acoustic Scene Classification via Impulse Response Augmentation
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2025)
di: Schmid, Florian, et al.
Pubblicazione: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
Sound Event Detection with Boundary-Aware Optimization and Inference
di: Schmid, Florian, et al.
Pubblicazione: (2026)
di: Schmid, Florian, et al.
Pubblicazione: (2026)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GAN
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
Perception-Inspired Graph Convolution for Music Understanding Tasks
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
di: Karystinaios, Emmanouil, et al.
Pubblicazione: (2024)
w2v-SELD: A Sound Event Localization and Detection Framework for Self-Supervised Spatial Audio Pre-Training
di: Santos, Orlem Lima dos, et al.
Pubblicazione: (2023)
di: Santos, Orlem Lima dos, et al.
Pubblicazione: (2023)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
di: Xie, Zeyu, et al.
Pubblicazione: (2023)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
di: Yin, Han, et al.
Pubblicazione: (2024)
di: Yin, Han, et al.
Pubblicazione: (2024)
AudioSpa: Spatializing Sound Events with Text
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
di: Feng, Linfeng, et al.
Pubblicazione: (2025)
Generating Diverse Audio-Visual 360 Soundscapes for Sound Event Localization and Detection
di: Roman, Adrian S., et al.
Pubblicazione: (2025)
di: Roman, Adrian S., et al.
Pubblicazione: (2025)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
di: Park, Sangwook, et al.
Pubblicazione: (2021)
di: Park, Sangwook, et al.
Pubblicazione: (2021)
JiTTER: Jigsaw Temporal Transformer for Event Reconstruction for Self-Supervised Sound Event Detection
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
Unified Audio Event Detection
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
di: Jiang, Yidi, et al.
Pubblicazione: (2024)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
ProLAP: Probabilistic Language-Audio Pre-Training
di: Manabe, Toranosuke, et al.
Pubblicazione: (2025)
di: Manabe, Toranosuke, et al.
Pubblicazione: (2025)
Joint Analysis of Acoustic Scenes and Sound Events Based on Semi-Supervised Training of Sound Events With Partial Labels
di: Imoto, Keisuke
Pubblicazione: (2025)
di: Imoto, Keisuke
Pubblicazione: (2025)
Exploring System Adaptations For Minimum Latency Real-Time Piano Transcription
di: Hu, Patricia, et al.
Pubblicazione: (2025)
di: Hu, Patricia, et al.
Pubblicazione: (2025)
PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection
di: Hu, Jinbo, et al.
Pubblicazione: (2024)
di: Hu, Jinbo, et al.
Pubblicazione: (2024)
Frequency Dynamic Convolutions for Sound Event Detection
di: Nam, Hyeonuk
Pubblicazione: (2025)
di: Nam, Hyeonuk
Pubblicazione: (2025)
Sounding Out Reconstruction Error-Based Evaluation of Generative Models of Expressive Performance
di: Peter, Silvan David, et al.
Pubblicazione: (2023)
di: Peter, Silvan David, et al.
Pubblicazione: (2023)
A Detailed Audio-Text Data Simulation Pipeline using Single-Event Sounds
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
MAGENTA: Magnitude and Geometry-ENhanced Training Approach for Robust Long-Tailed Sound Event Localization and Detection
di: Yeow, Jun-Wei, et al.
Pubblicazione: (2025)
di: Yeow, Jun-Wei, et al.
Pubblicazione: (2025)
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
The Sounds of Home: A Speech-Removed Residential Audio Dataset for Sound Event Detection
di: Bibbó, Gabriel, et al.
Pubblicazione: (2024)
di: Bibbó, Gabriel, et al.
Pubblicazione: (2024)
Zero- and Few-shot Sound Event Localization and Detection
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
di: Shimada, Kazuki, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024) -
Exploring Performance-Complexity Trade-Offs in Sound Event Detection Models
di: Morocutti, Tobias, et al.
Pubblicazione: (2025) -
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025) -
Multi-Iteration Multi-Stage Fine-Tuning of Transformers for Sound Event Detection with Heterogeneous Datasets
di: Schmid, Florian, et al.
Pubblicazione: (2024) -
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)