Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Xilin, Han, Cong, Mesgarani, Nima |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
par: Jiang, Xilin, et autres
Publié: (2024)
par: Jiang, Xilin, et autres
Publié: (2024)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
par: Li, Yinghao Aaron, et autres
Publié: (2024)
par: Li, Yinghao Aaron, et autres
Publié: (2024)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
par: Jiang, Xilin, et autres
Publié: (2024)
par: Jiang, Xilin, et autres
Publié: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024)
par: Gao, Xiaoxue, et autres
Publié: (2024)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
par: Jiang, Xilin, et autres
Publié: (2023)
par: Jiang, Xilin, et autres
Publié: (2023)
Exploring Finetuned Audio-LLM on Heart Murmur Features
par: Florea, Adrian, et autres
Publié: (2025)
par: Florea, Adrian, et autres
Publié: (2025)
XLSR-Mamba: A Dual-Column Bidirectional State Space Model for Spoofing Attack Detection
par: Xiao, Yang, et autres
Publié: (2024)
par: Xiao, Yang, et autres
Publié: (2024)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
par: Shams, Siavash, et autres
Publié: (2024)
par: Shams, Siavash, et autres
Publié: (2024)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
Interpretable Embeddings of Speech Enhance and Explain Brain Encoding Performance of Audio Models
par: Shimizu, Riki, et autres
Publié: (2025)
par: Shimizu, Riki, et autres
Publié: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
par: Wang, Qiaolin, et autres
Publié: (2025)
par: Wang, Qiaolin, et autres
Publié: (2025)
BiCrossMamba-ST: Speech Deepfake Detection with Bidirectional Mamba Spectro-Temporal Cross-Attention
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024)
par: Colombo, Marco Furio, et autres
Publié: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
par: Erol, Mehmet Hamza, et autres
Publié: (2024)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
par: Jiang, Xilin, et autres
Publié: (2025)
par: Jiang, Xilin, et autres
Publié: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
Multi-Utterance Speech Separation and Association Trained on Short Segments
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025)
par: Ding, Hanyu, et autres
Publié: (2025)
DeepSpeech models show Human-like Performance and Processing of Cochlear Implant Inputs
par: Steinhardt, Cynthia R., et autres
Publié: (2024)
par: Steinhardt, Cynthia R., et autres
Publié: (2024)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
par: Shimizu, Riki, et autres
Publié: (2025)
par: Shimizu, Riki, et autres
Publié: (2025)
SAM: A Mamba-2 State-Space Audio-Language Model
par: Lee, Taehan, et autres
Publié: (2025)
par: Lee, Taehan, et autres
Publié: (2025)
RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection
par: Chen, Yujie, et autres
Publié: (2024)
par: Chen, Yujie, et autres
Publié: (2024)
Exploring the Capability of Mamba in Speech Applications
par: Miyazaki, Koichi, et autres
Publié: (2024)
par: Miyazaki, Koichi, et autres
Publié: (2024)
A Comparative Study on Positional Encoding for Time-frequency Domain Dual-path Transformer-based Source Separation Models
par: Saijo, Kohei, et autres
Publié: (2025)
par: Saijo, Kohei, et autres
Publié: (2025)
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2025)
par: Farhadipour, Aref, et autres
Publié: (2025)
Speech Enhancement with Dual-path Multi-Channel Linear Prediction Filter and Multi-norm Beamforming
par: Qin, Chengyuan, et autres
Publié: (2025)
par: Qin, Chengyuan, et autres
Publié: (2025)
Cross-Talk Speech Reduction, by Separation, for Separation
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Unsupervised Multi-channel Separation and Adaptation
par: Han, Cong, et autres
Publié: (2023)
par: Han, Cong, et autres
Publié: (2023)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
par: Li, Jizhen, et autres
Publié: (2025)
par: Li, Jizhen, et autres
Publié: (2025)
DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
par: Wang, Yuanyuan, et autres
Publié: (2025)
par: Wang, Yuanyuan, et autres
Publié: (2025)
Exploring Efficient Directional and Distance Cues for Regional Speech Separation
par: Jiang, Yiheng, et autres
Publié: (2025)
par: Jiang, Yiheng, et autres
Publié: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
par: He, Linyang, et autres
Publié: (2025)
par: He, Linyang, et autres
Publié: (2025)
SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
par: Zhao, Changjiang, et autres
Publié: (2024)
par: Zhao, Changjiang, et autres
Publié: (2024)
FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
par: Cao, Junjie, et autres
Publié: (2025)
par: Cao, Junjie, et autres
Publié: (2025)
Hyperbolic Distance-Based Speech Separation
par: Petermann, Darius, et autres
Publié: (2024)
par: Petermann, Darius, et autres
Publié: (2024)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
par: Lee, Dongheon, et autres
Publié: (2024)
par: Lee, Dongheon, et autres
Publié: (2024)
Documents similaires
-
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
par: Jiang, Xilin, et autres
Publié: (2024) -
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
par: Li, Yinghao Aaron, et autres
Publié: (2024) -
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
par: Jiang, Xilin, et autres
Publié: (2024) -
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
par: Gao, Xiaoxue, et autres
Publié: (2024) -
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
par: Jiang, Xilin, et autres
Publié: (2023)