A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jie, Yan, Haoyin, Li, Xiaofei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Selective State Space Model for Monaural Speech Enhancement
di: Chen, Moran, et al.
Pubblicazione: (2024)
di: Chen, Moran, et al.
Pubblicazione: (2024)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
di: Liu, Yinghao, et al.
Pubblicazione: (2026)
di: Liu, Yinghao, et al.
Pubblicazione: (2026)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2025)
di: Yan, Haoyin, et al.
Pubblicazione: (2025)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
di: Wang, Tingting, et al.
Pubblicazione: (2025)
di: Wang, Tingting, et al.
Pubblicazione: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
di: Li, Yi, et al.
Pubblicazione: (2024)
di: Li, Yi, et al.
Pubblicazione: (2024)
CaSNet: Compress-and-Send Network Based Multi-Device Speech Enhancement Model for Distributed Microphone Arrays
di: Jiang, Chengqian, et al.
Pubblicazione: (2026)
di: Jiang, Chengqian, et al.
Pubblicazione: (2026)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
Rec-RIR: Monaural Blind Room Impulse Response Identification via DNN-based Reverberant Speech Reconstruction in STFT Domain
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
SE Territory: Monaural Speech Enhancement Meets the Fixed Virtual Perceptual Space Mapping
di: Xu, Xinmeng, et al.
Pubblicazione: (2023)
di: Xu, Xinmeng, et al.
Pubblicazione: (2023)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
di: Zhao, Shengkui, et al.
Pubblicazione: (2022)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2024)
di: Wang, Junyu, et al.
Pubblicazione: (2024)
Forward Convolutive Prediction for Frame Online Monaural Speech Dereverberation Based on Kronecker Product Decomposition
di: Zhu, Yujie, et al.
Pubblicazione: (2025)
di: Zhu, Yujie, et al.
Pubblicazione: (2025)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
Spectral Masking with Explicit Time-Context Windowing for Neural Network-Based Monaural Speech Enhancement
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation
di: Song, Siqi, et al.
Pubblicazione: (2026)
di: Song, Siqi, et al.
Pubblicazione: (2026)
Deep Filter Estimation from Inter-Frame Correlations for Monaural Speech Dereverberation
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2026)
di: Shin, Ui-Hyeop, et al.
Pubblicazione: (2026)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Spiking Structured State Space Model for Monaural Speech Enhancement
di: Du, Yu, et al.
Pubblicazione: (2023)
di: Du, Yu, et al.
Pubblicazione: (2023)
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
di: Abdulatif, Sherif, et al.
Pubblicazione: (2022)
di: Abdulatif, Sherif, et al.
Pubblicazione: (2022)
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
di: Dai, Wang, et al.
Pubblicazione: (2024)
di: Dai, Wang, et al.
Pubblicazione: (2024)
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
di: Zhao, Shengkui, et al.
Pubblicazione: (2021)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
di: Hou, Mingchi, et al.
Pubblicazione: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
Exploring Length Generalization For Transformer-based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
di: Li, Xingchen, et al.
Pubblicazione: (2025)
di: Li, Xingchen, et al.
Pubblicazione: (2025)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
di: Chen, Yanan, et al.
Pubblicazione: (2024)
di: Chen, Yanan, et al.
Pubblicazione: (2024)
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
di: Zhang, Jie, et al.
Pubblicazione: (2023)
di: Zhang, Jie, et al.
Pubblicazione: (2023)
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
Schrödinger Bridge for Generative Speech Enhancement
di: Jukić, Ante, et al.
Pubblicazione: (2024)
di: Jukić, Ante, et al.
Pubblicazione: (2024)
MeanSE: Efficient Generative Speech Enhancement with Mean Flows
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
di: Zhao, Shengkui, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Selective State Space Model for Monaural Speech Enhancement
di: Chen, Moran, et al.
Pubblicazione: (2024) -
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
di: Liu, Yinghao, et al.
Pubblicazione: (2026) -
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2025) -
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
di: Zhang, Qiquan, et al.
Pubblicazione: (2025) -
Learning Time-Graph Frequency Representation for Monaural Speech Enhancement
di: Wang, Tingting, et al.
Pubblicazione: (2025)