Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Jiaju, Hu, Haoxuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
Perceptual Musical Features for Interpretable Audio Tagging
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices
di: Grau-Haro, Jordi, et al.
Pubblicazione: (2025)
di: Grau-Haro, Jordi, et al.
Pubblicazione: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
di: Burchett-Vass, Rhys, et al.
Pubblicazione: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging
di: Singh, Shubhr, et al.
Pubblicazione: (2025)
di: Singh, Shubhr, et al.
Pubblicazione: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
di: Shi, Qundong, et al.
Pubblicazione: (2026)
di: Shi, Qundong, et al.
Pubblicazione: (2026)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
di: Liu, Haohe, et al.
Pubblicazione: (2023)
di: Liu, Haohe, et al.
Pubblicazione: (2023)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
SAM: A Mamba-2 State-Space Audio-Language Model
di: Lee, Taehan, et al.
Pubblicazione: (2025)
di: Lee, Taehan, et al.
Pubblicazione: (2025)
Pretrained Conformers for Audio Fingerprinting and Retrieval
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
di: Altwlkany, Kemal, et al.
Pubblicazione: (2025)
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
Stable Audio Open
di: Evans, Zach, et al.
Pubblicazione: (2024)
di: Evans, Zach, et al.
Pubblicazione: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Audio Explanation Synthesis with Generative Foundation Models
di: Akman, Alican, et al.
Pubblicazione: (2024)
di: Akman, Alican, et al.
Pubblicazione: (2024)
Estimating Musical Surprisal in Audio
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
di: Qiu, Kai, et al.
Pubblicazione: (2024)
di: Qiu, Kai, et al.
Pubblicazione: (2024)
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024) -
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
di: Yadav, Sarthak, et al.
Pubblicazione: (2024) -
Perceptual Musical Features for Interpretable Audio Tagging
di: Lyberatos, Vassilis, et al.
Pubblicazione: (2023) -
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
di: Mei, Xinhao, et al.
Pubblicazione: (2026) -
Comprehensive Evaluation of CNN-Based Audio Tagging Models on Resource-Constrained Devices
di: Grau-Haro, Jordi, et al.
Pubblicazione: (2025)