SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Changjiang, He, Shulin, Zhang, Xueliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Room Impulse Response as a Prompt for Acoustic Echo Cancellation
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
Robust Target Speaker Direction of Arrival Estimation
por: Li, Zixuan, et al.
Publicado: (2024)
por: Li, Zixuan, et al.
Publicado: (2024)
Advances in Speech Separation: Techniques, Challenges, and Future Trends
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
por: Bai, Jinglin, et al.
Publicado: (2024)
por: Bai, Jinglin, et al.
Publicado: (2024)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
por: Li, Jizhen, et al.
Publicado: (2025)
por: Li, Jizhen, et al.
Publicado: (2025)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
por: Saijo, Kohei, et al.
Publicado: (2024)
por: Saijo, Kohei, et al.
Publicado: (2024)
VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone Arrays
por: He, Shulin, et al.
Publicado: (2025)
por: He, Shulin, et al.
Publicado: (2025)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
por: He, Shulin, et al.
Publicado: (2023)
por: He, Shulin, et al.
Publicado: (2023)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
por: Ma, Ding, et al.
Publicado: (2026)
por: Ma, Ding, et al.
Publicado: (2026)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
por: Fang, Yuan, et al.
Publicado: (2024)
por: Fang, Yuan, et al.
Publicado: (2024)
Hierarchical speaker representation for target speaker extraction
por: He, Shulin, et al.
Publicado: (2022)
por: He, Shulin, et al.
Publicado: (2022)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
Listen to Extract: Onset-Prompted Target Speaker Extraction
por: Shen, Pengjie, et al.
Publicado: (2025)
por: Shen, Pengjie, et al.
Publicado: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
por: Gao, Xiaoxue, et al.
Publicado: (2024)
por: Gao, Xiaoxue, et al.
Publicado: (2024)
Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
por: Zhao, Jiaqi, et al.
Publicado: (2024)
por: Zhao, Jiaqi, et al.
Publicado: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
por: Farhadipour, Aref, et al.
Publicado: (2025)
por: Farhadipour, Aref, et al.
Publicado: (2025)
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
por: Zhao, Haixin, et al.
Publicado: (2025)
por: Zhao, Haixin, et al.
Publicado: (2025)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
por: Sutherland, Robert, et al.
Publicado: (2024)
por: Sutherland, Robert, et al.
Publicado: (2024)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
por: Cui, Zhongjian, et al.
Publicado: (2025)
por: Cui, Zhongjian, et al.
Publicado: (2025)
Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival Estimation
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
por: Li, Yi, et al.
Publicado: (2024)
por: Li, Yi, et al.
Publicado: (2024)
ICASSP 2026 URGENT Speech Enhancement Challenge
por: Li, Chenda, et al.
Publicado: (2026)
por: Li, Chenda, et al.
Publicado: (2026)
Improving Design of Input Condition Invariant Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Investigating the Design Space of Diffusion Models for Speech Enhancement
por: Gonzalez, Philippe, et al.
Publicado: (2023)
por: Gonzalez, Philippe, et al.
Publicado: (2023)
Absorbing Discrete Diffusion for Speech Enhancement
por: Gonzalez, Philippe
Publicado: (2026)
por: Gonzalez, Philippe
Publicado: (2026)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
por: Sato, Hiroshi, et al.
Publicado: (2025)
por: Sato, Hiroshi, et al.
Publicado: (2025)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
por: Wang, Jiahe, et al.
Publicado: (2025)
por: Wang, Jiahe, et al.
Publicado: (2025)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement
por: Hou, Zhongshu, et al.
Publicado: (2024)
por: Hou, Zhongshu, et al.
Publicado: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2025)
por: Lin, Zizhen, et al.
Publicado: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
por: de Groot, Dimme, et al.
Publicado: (2025)
por: de Groot, Dimme, et al.
Publicado: (2025)
Ejemplares similares
-
Room Impulse Response as a Prompt for Acoustic Echo Cancellation
por: Zhao, Fei, et al.
Publicado: (2025) -
Robust Target Speaker Direction of Arrival Estimation
por: Li, Zixuan, et al.
Publicado: (2024) -
Advances in Speech Separation: Techniques, Challenges, and Future Trends
por: Li, Kai, et al.
Publicado: (2025) -
Attention-Based Beamformer For Multi-Channel Speech Enhancement
por: Bai, Jinglin, et al.
Publicado: (2024) -
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)