SPMamba: State-space model is all you need in speech separation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Kai, Chen, Guo, Yang, Runxuan, Hu, Xiaolin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios
par: Li, Kai, et autres
Publié: (2024)
par: Li, Kai, et autres
Publié: (2024)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
par: Chen, Guo, et autres
Publié: (2025)
par: Chen, Guo, et autres
Publié: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
par: Yang, Runxuan, et autres
Publié: (2025)
par: Yang, Runxuan, et autres
Publié: (2025)
TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation
par: Xu, Mohan, et autres
Publié: (2024)
par: Xu, Mohan, et autres
Publié: (2024)
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
par: Pegg, Samuel, et autres
Publié: (2024)
par: Pegg, Samuel, et autres
Publié: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens
par: Du, Zhihao, et autres
Publié: (2024)
par: Du, Zhihao, et autres
Publié: (2024)
A correlation-permutation approach for speech-music encoders model merging
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
Enhancing CTC-based speech recognition with diverse modeling units
par: Han, Shiyi, et autres
Publié: (2024)
par: Han, Shiyi, et autres
Publié: (2024)
AS-70: A Mandarin stuttered speech dataset for automatic speech recognition and stuttering event detection
par: Gong, Rong, et autres
Publié: (2024)
par: Gong, Rong, et autres
Publié: (2024)
Ensemble of classifiers for speech evaluation
par: Belokrylov, G., et autres
Publié: (2024)
par: Belokrylov, G., et autres
Publié: (2024)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
par: Zhang, Fan, et autres
Publié: (2023)
par: Zhang, Fan, et autres
Publié: (2023)
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
Online neural fusion of distortionless differential beamformers for robust speech enhancement
par: Qian, Yuanhang, et autres
Publié: (2025)
par: Qian, Yuanhang, et autres
Publié: (2025)
A unified multichannel far-field speech recognition system: combining neural beamforming with attention based end-to-end model
par: Zhao, Dongdi, et autres
Publié: (2024)
par: Zhao, Dongdi, et autres
Publié: (2024)
Heterogeneous bimodal attention fusion for speech emotion recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
learning discriminative features from spectrograms using center loss for speech emotion recognition
par: Dai, Dongyang, et autres
Publié: (2025)
par: Dai, Dongyang, et autres
Publié: (2025)
FINALLY: fast and universal speech enhancement with studio-like quality
par: Babaev, Nicholas, et autres
Publié: (2024)
par: Babaev, Nicholas, et autres
Publié: (2024)
Automated evaluation of children's speech fluency for low-resource languages
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
Selective Classifier-free Guidance for Zero-shot Text-to-speech
par: Zheng, John, et autres
Publié: (2025)
par: Zheng, John, et autres
Publié: (2025)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026)
par: Liu, Hanwen, et autres
Publié: (2026)
Lightweight End-to-end Text-to-speech Synthesis for low resource on-device applications
par: Vecino, Biel Tura, et autres
Publié: (2025)
par: Vecino, Biel Tura, et autres
Publié: (2025)
Omni-directional attention mechanism based on Mamba for speech separation
par: Xue, Ke, et autres
Publié: (2026)
par: Xue, Ke, et autres
Publié: (2026)
Are you sure? Analysing Uncertainty Quantification Approaches for Real-world Speech Emotion Recognition
par: Schrüfer, Oliver, et autres
Publié: (2024)
par: Schrüfer, Oliver, et autres
Publié: (2024)
Speech Quality Assessment Model Based on Mixture of Experts: System-Level Performance Enhancement and Utterance-Level Challenge Analysis
par: Hu, Xintong, et autres
Publié: (2025)
par: Hu, Xintong, et autres
Publié: (2025)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Unlocking Temporal Flexibility: Neural Speech Codec with Variable Frame Rate
par: Zhang, Hanglei, et autres
Publié: (2025)
par: Zhang, Hanglei, et autres
Publié: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
par: Guo, Yiwei, et autres
Publié: (2025)
par: Guo, Yiwei, et autres
Publié: (2025)
Determined blind source separation via modeling adjacent frequency band correlations in speech signals
par: Wang, Jianyu, et autres
Publié: (2025)
par: Wang, Jianyu, et autres
Publié: (2025)
Multichannel blind speech source separation with a disjoint constraint source model
par: Wang, Jianyu, et autres
Publié: (2024)
par: Wang, Jianyu, et autres
Publié: (2024)
ASD-Diffusion: Anomalous Sound Detection with Diffusion Models
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
par: Chen, Jinming, et autres
Publié: (2025)
par: Chen, Jinming, et autres
Publié: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Do we really need Self-Attention for Streaming Automatic Speech Recognition?
par: Dkhissi, Youness, et autres
Publié: (2026)
par: Dkhissi, Youness, et autres
Publié: (2026)
Apollo: Band-sequence Modeling for High-Quality Audio Restoration
par: Li, Kai, et autres
Publié: (2024)
par: Li, Kai, et autres
Publié: (2024)
Exploring State-Space-Model based Language Model in Music Generation
par: Lee, Wei-Jaw, et autres
Publié: (2025)
par: Lee, Wei-Jaw, et autres
Publié: (2025)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
SPGM: Prioritizing Local Features for enhanced speech separation performance
par: Yip, Jia Qi, et autres
Publié: (2023)
par: Yip, Jia Qi, et autres
Publié: (2023)
Documents similaires
-
SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios
par: Li, Kai, et autres
Publié: (2024) -
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
par: Chen, Guo, et autres
Publié: (2025) -
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
par: Yang, Runxuan, et autres
Publié: (2025) -
TIGER: Time-frequency Interleaved Gain Extraction and Reconstruction for Efficient Speech Separation
par: Xu, Mohan, et autres
Publié: (2024) -
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
par: Pegg, Samuel, et autres
Publié: (2024)