Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Xilin, Li, Yinghao Aaron, Florea, Adrian Nicolas, Han, Cong, Mesgarani, Nima |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Exploring Finetuned Audio-LLM on Heart Murmur Features
di: Florea, Adrian, et al.
Pubblicazione: (2025)
di: Florea, Adrian, et al.
Pubblicazione: (2025)
Interpretable Embeddings of Speech Enhance and Explain Brain Encoding Performance of Audio Models
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2025)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
DeepSpeech models show Human-like Performance and Processing of Cochlear Implant Inputs
di: Steinhardt, Cynthia R., et al.
Pubblicazione: (2024)
di: Steinhardt, Cynthia R., et al.
Pubblicazione: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
ArrayDPS: Unsupervised Blind Speech Separation with a Diffusion Prior
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2025)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
di: Shams, Siavash, et al.
Pubblicazione: (2024)
di: Shams, Siavash, et al.
Pubblicazione: (2024)
Speech to Speech Synthesis for Voice Impersonation
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
di: Johnson, Bjorn, et al.
Pubblicazione: (2026)
Meeting Recognition with Continuous Speech Separation and Transcription-Supported Diarization
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
di: von Neumann, Thilo, et al.
Pubblicazione: (2023)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
Exploring the Capability of Mamba in Speech Applications
di: Miyazaki, Koichi, et al.
Pubblicazione: (2024)
di: Miyazaki, Koichi, et al.
Pubblicazione: (2024)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
di: Ochiai, Tsubasa, et al.
Pubblicazione: (2024)
di: Ochiai, Tsubasa, et al.
Pubblicazione: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
Towards Audio Codec-based Speech Separation
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
di: Yip, Jia Qi, et al.
Pubblicazione: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Cross-Talk Speech Reduction, by Separation, for Separation
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2026)
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
di: Jiang, Xilin, et al.
Pubblicazione: (2025)
di: Jiang, Xilin, et al.
Pubblicazione: (2025)
Multi-blank Transducers for Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2022)
di: Xu, Hainan, et al.
Pubblicazione: (2022)
In-Materia Speech Recognition
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
di: Do, Cong-Thanh, et al.
Pubblicazione: (2024)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
Test-Time Adaptation for Speech Emotion Recognition
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
di: Dong, Jiaheng, et al.
Pubblicazione: (2026)
Drax: Speech Recognition with Discrete Flow Matching
di: Navon, Aviv, et al.
Pubblicazione: (2025)
di: Navon, Aviv, et al.
Pubblicazione: (2025)
Adapting WavLM for Speech Emotion Recognition
di: Diatlova, Daria, et al.
Pubblicazione: (2024)
di: Diatlova, Daria, et al.
Pubblicazione: (2024)
Keyword-Guided Adaptation of Automatic Speech Recognition
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
Hyperbolic Distance-Based Speech Separation
di: Petermann, Darius, et al.
Pubblicazione: (2024)
di: Petermann, Darius, et al.
Pubblicazione: (2024)
Exploring Efficient Directional and Distance Cues for Regional Speech Separation
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
di: Jiang, Yiheng, et al.
Pubblicazione: (2025)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
Documenti analoghi
-
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
di: Jiang, Xilin, et al.
Pubblicazione: (2024) -
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024) -
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023) -
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
di: Jiang, Xilin, et al.
Pubblicazione: (2024) -
Exploring Finetuned Audio-LLM on Heart Murmur Features
di: Florea, Adrian, et al.
Pubblicazione: (2025)