Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Qiquan, Chen, Moran, Song, Zeyang, Liu, Hexin, Zhang, Xiangyu, Li, Haizhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Selective State Space Model for Monaural Speech Enhancement
por: Chen, Moran, et al.
Publicado: (2024)
por: Chen, Moran, et al.
Publicado: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
por: Wang, Tingting, et al.
Publicado: (2025)
por: Wang, Tingting, et al.
Publicado: (2025)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
por: Liu, Hexin, et al.
Publicado: (2025)
por: Liu, Hexin, et al.
Publicado: (2025)
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Exploring Length Generalization For Transformer-based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
por: Li, Yi, et al.
Publicado: (2024)
por: Li, Yi, et al.
Publicado: (2024)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
por: Fiorio, Luan Vinícius, et al.
Publicado: (2024)
por: Fiorio, Luan Vinícius, et al.
Publicado: (2024)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
por: Qian, Xinyuan, et al.
Publicado: (2024)
por: Qian, Xinyuan, et al.
Publicado: (2024)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
SE Territory: Monaural Speech Enhancement Meets the Fixed Virtual Perceptual Space Mapping
por: Xu, Xinmeng, et al.
Publicado: (2023)
por: Xu, Xinmeng, et al.
Publicado: (2023)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation
por: Song, Siqi, et al.
Publicado: (2026)
por: Song, Siqi, et al.
Publicado: (2026)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
por: Zhao, Shengkui, et al.
Publicado: (2022)
por: Zhao, Shengkui, et al.
Publicado: (2022)
Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement
por: Wang, Tingting, et al.
Publicado: (2024)
por: Wang, Tingting, et al.
Publicado: (2024)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
por: Wang, Junyu, et al.
Publicado: (2024)
por: Wang, Junyu, et al.
Publicado: (2024)
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
por: Zhang, Jie, et al.
Publicado: (2023)
por: Zhang, Jie, et al.
Publicado: (2023)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Spiking Structured State Space Model for Monaural Speech Enhancement
por: Du, Yu, et al.
Publicado: (2023)
por: Du, Yu, et al.
Publicado: (2023)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
por: Liu, Hexin, et al.
Publicado: (2024)
por: Liu, Hexin, et al.
Publicado: (2024)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
por: Wang, Haoxu, et al.
Publicado: (2025)
por: Wang, Haoxu, et al.
Publicado: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
IML-Spikeformer: Input-aware Multi-Level Spiking Transformer for Speech Processing
por: Song, Zeyang, et al.
Publicado: (2025)
por: Song, Zeyang, et al.
Publicado: (2025)
Deep Filter Estimation from Inter-Frame Correlations for Monaural Speech Dereverberation
por: Shin, Ui-Hyeop, et al.
Publicado: (2026)
por: Shin, Ui-Hyeop, et al.
Publicado: (2026)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
por: Meng, Hanyu, et al.
Publicado: (2025)
por: Meng, Hanyu, et al.
Publicado: (2025)
Forward Convolutive Prediction for Frame Online Monaural Speech Dereverberation Based on Kronecker Product Decomposition
por: Zhu, Yujie, et al.
Publicado: (2025)
por: Zhu, Yujie, et al.
Publicado: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
por: Yang, Yufeng, et al.
Publicado: (2024)
por: Yang, Yufeng, et al.
Publicado: (2024)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
por: Zhang, Haoyang, et al.
Publicado: (2026)
por: Zhang, Haoyang, et al.
Publicado: (2026)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
por: Zhao, Shengkui, et al.
Publicado: (2023)
por: Zhao, Shengkui, et al.
Publicado: (2023)
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
por: Abdulatif, Sherif, et al.
Publicado: (2022)
por: Abdulatif, Sherif, et al.
Publicado: (2022)
ED-sKWS: Early-Decision Spiking Neural Networks for Rapid,and Energy-Efficient Keyword Spotting
por: Song, Zeyang, et al.
Publicado: (2024)
por: Song, Zeyang, et al.
Publicado: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
por: Zhao, Shengkui, et al.
Publicado: (2021)
por: Zhao, Shengkui, et al.
Publicado: (2021)
Ejemplares similares
-
Selective State Space Model for Monaural Speech Enhancement
por: Chen, Moran, et al.
Publicado: (2024) -
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024) -
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
por: Wang, Tingting, et al.
Publicado: (2025) -
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
por: Liu, Hexin, et al.
Publicado: (2025) -
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
por: Zhang, Xiangyu, et al.
Publicado: (2025)