Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Erol, Mehmet Hamza, Senocak, Arda, Feng, Jiu, Chung, Joon Son |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
por: Park, Sooyoung, et al.
Publicado: (2025)
por: Park, Sooyoung, et al.
Publicado: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
por: Senocak, Arda, et al.
Publicado: (2024)
por: Senocak, Arda, et al.
Publicado: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025)
por: Lee, Taehan, et al.
Publicado: (2025)
BrewCLIP: A Bifurcated Representation Learning Framework for Audio-Visual Retrieval
por: Lu, Zhenyu, et al.
Publicado: (2024)
por: Lu, Zhenyu, et al.
Publicado: (2024)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
por: Wilkinghoff, Kevin, et al.
Publicado: (2025)
por: Wilkinghoff, Kevin, et al.
Publicado: (2025)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces
por: Bjare, Mathias Rose, et al.
Publicado: (2025)
por: Bjare, Mathias Rose, et al.
Publicado: (2025)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
Generalizable Audio Spoofing Detection using Non-Semantic Representations
por: Das, Arnab, et al.
Publicado: (2025)
por: Das, Arnab, et al.
Publicado: (2025)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
por: Shi, Qundong, et al.
Publicado: (2026)
por: Shi, Qundong, et al.
Publicado: (2026)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
por: Nam, KiHyun, et al.
Publicado: (2025)
por: Nam, KiHyun, et al.
Publicado: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
por: Chen, Yujie, et al.
Publicado: (2024)
por: Chen, Yujie, et al.
Publicado: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
PALM: Few-Shot Prompt Learning for Audio Language Models
por: Hanif, Asif, et al.
Publicado: (2024)
por: Hanif, Asif, et al.
Publicado: (2024)
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
WavShape: Information-Theoretic Speech Representation Learning for Fair and Privacy-Aware Audio Processing
por: Baser, Oguzhan, et al.
Publicado: (2025)
por: Baser, Oguzhan, et al.
Publicado: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026)
por: Nam, KiHyun, et al.
Publicado: (2026)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
por: Yang, Haoyun, et al.
Publicado: (2026)
por: Yang, Haoyun, et al.
Publicado: (2026)
AudioScene: Integrating Object-Event Audio into 3D Scenes
por: Yuan, Shuaihang, et al.
Publicado: (2025)
por: Yuan, Shuaihang, et al.
Publicado: (2025)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
Stable Audio Open
por: Evans, Zach, et al.
Publicado: (2024)
por: Evans, Zach, et al.
Publicado: (2024)
Audio Explanation Synthesis with Generative Foundation Models
por: Akman, Alican, et al.
Publicado: (2024)
por: Akman, Alican, et al.
Publicado: (2024)
Ejemplares similares
-
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024) -
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024) -
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025) -
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026) -
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)