Scaling up masked audio encoder learning for general audio classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Dinkel, Heinrich, Yan, Zhiyong, Wang, Yongqing, Zhang, Junbo, Wang, Yujun, Wang, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
GLAP: General contrastive audio-text pretraining across domains and languages
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
DashengTokenizer: One layer is enough for unified audio understanding and generation
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
Blind estimation of audio effects using an auto-encoder approach and differentiable digital signal processing
di: Peladeau, Côme, et al.
Pubblicazione: (2023)
di: Peladeau, Côme, et al.
Pubblicazione: (2023)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Testing chatbots on the creation of encoders for audio conditioned image generation
di: León, Jorge E., et al.
Pubblicazione: (2025)
di: León, Jorge E., et al.
Pubblicazione: (2025)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
AxLSTMs: learning self-supervised audio representations with xLSTMs
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
Deep learning based spatial aliasing reduction in beamforming for audio capture
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
di: Guzik, Mateusz, et al.
Pubblicazione: (2025)
Towards audio language modeling -- an overview
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
The ICME 2025 Audio Encoder Capability Challenge
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Visual-based spatial audio generation system for multi-speaker environments
di: Liu, Xiaojing, et al.
Pubblicazione: (2025)
di: Liu, Xiaojing, et al.
Pubblicazione: (2025)
A robust audio deepfake detection system via multi-view feature
di: Yang, Yujie, et al.
Pubblicazione: (2024)
di: Yang, Yujie, et al.
Pubblicazione: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
di: Zhang, Ruonan, et al.
Pubblicazione: (2025)
Are audio DeepFake detection models polyglots?
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
di: Marek, Bartłomiej, et al.
Pubblicazione: (2024)
ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks
di: Jing, Xin, et al.
Pubblicazione: (2024)
di: Jing, Xin, et al.
Pubblicazione: (2024)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Efficient learning-based sound propagation for virtual and real-world audio processing applications
di: Ratnarajah, Anton Jeran
Pubblicazione: (2024)
di: Ratnarajah, Anton Jeran
Pubblicazione: (2024)
WavJEPA: Semantic learning unlocks robust audio foundation models for raw waveforms
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
di: Yuksel, Goksenin, et al.
Pubblicazione: (2025)
An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
di: Han, Runduo, et al.
Pubblicazione: (2024)
di: Han, Runduo, et al.
Pubblicazione: (2024)
Tweaking autoregressive methods for inpainting of gaps in audio signals
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
Real-time implementation of vibrato transfer as an audio effect
di: Hyrkas, Jeremy
Pubblicazione: (2025)
di: Hyrkas, Jeremy
Pubblicazione: (2025)
STASE: A spatialized text-to-audio synthesis engine for music generation
di: Chi, Tutti, et al.
Pubblicazione: (2025)
di: Chi, Tutti, et al.
Pubblicazione: (2025)
Synthetic training set generation using text-to-audio models for environmental sound classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
di: Ronchini, Francesca, et al.
Pubblicazione: (2024)
Towards generalizing deep-audio fake detection networks
di: Gasenzer, Konstantin, et al.
Pubblicazione: (2023)
di: Gasenzer, Konstantin, et al.
Pubblicazione: (2023)
Regularized autoregressive modeling and its application to audio signal reconstruction
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
di: Mokrý, Ondřej, et al.
Pubblicazione: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
di: Tan, Liwen, et al.
Pubblicazione: (2024)
di: Tan, Liwen, et al.
Pubblicazione: (2024)
Speaker anonymization using neural audio codec language models
di: Panariello, Michele, et al.
Pubblicazione: (2023)
di: Panariello, Michele, et al.
Pubblicazione: (2023)
FxSearcher: gradient-free text-driven audio transformation
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
di: Ki, Hojoon, et al.
Pubblicazione: (2025)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
di: Das, Sneha, et al.
Pubblicazione: (2020)
di: Das, Sneha, et al.
Pubblicazione: (2020)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
di: Takano, Taisei, et al.
Pubblicazione: (2025)
di: Takano, Taisei, et al.
Pubblicazione: (2025)
Versatile audio-visual learning for emotion recognition
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
di: Goncalves, Lucas, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023) -
GLAP: General contrastive audio-text pretraining across domains and languages
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025) -
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024) -
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026) -
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)