Adaptive Convolution for CNN-based Speech Enhancement Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Dahan, Rong, Xiaobin, Sun, Shiruo, Hu, Yuxiang, Zhu, Changbao, Lu, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UL-UNAS: Ultra-Lightweight U-Nets for Real-Time Speech Enhancement via Network Architecture Search
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
por: Wang, Dahan, et al.
Publicado: (2026)
por: Wang, Dahan, et al.
Publicado: (2026)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement
por: Hou, Zhongshu, et al.
Publicado: (2024)
por: Hou, Zhongshu, et al.
Publicado: (2024)
TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement
por: Saijo, Kohei, et al.
Publicado: (2024)
por: Saijo, Kohei, et al.
Publicado: (2024)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
por: Zhao, Changjiang, et al.
Publicado: (2024)
por: Zhao, Changjiang, et al.
Publicado: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model
por: Xiang, Yang, et al.
Publicado: (2025)
por: Xiang, Yang, et al.
Publicado: (2025)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
por: Li, Yi, et al.
Publicado: (2024)
por: Li, Yi, et al.
Publicado: (2024)
A Lightweight Fourier-based Network for Binaural Speech Enhancement with Spatial Cue Preservation
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
por: Luo, Longjie, et al.
Publicado: (2025)
por: Luo, Longjie, et al.
Publicado: (2025)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
Diffusion-based Signal Refiner for Speech Enhancement and Separation
por: Hirano, Masato, et al.
Publicado: (2023)
por: Hirano, Masato, et al.
Publicado: (2023)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
por: Sutherland, Robert, et al.
Publicado: (2024)
por: Sutherland, Robert, et al.
Publicado: (2024)
Universal Score-based Speech Enhancement with High Content Preservation
por: Scheibler, Robin, et al.
Publicado: (2024)
por: Scheibler, Robin, et al.
Publicado: (2024)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
por: Lin, Zizhen, et al.
Publicado: (2025)
por: Lin, Zizhen, et al.
Publicado: (2025)
Schrödinger Bridge Consistency Trajectory Models for Speech Enhancement
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
por: Nishigori, Shuichiro, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
por: Zhang, Yuewei, et al.
Publicado: (2025)
por: Zhang, Yuewei, et al.
Publicado: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
por: Wang, Haoxu, et al.
Publicado: (2025)
por: Wang, Haoxu, et al.
Publicado: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
por: Li, Jizhen, et al.
Publicado: (2024)
por: Li, Jizhen, et al.
Publicado: (2024)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
por: Sun, Xingwei, et al.
Publicado: (2025)
por: Sun, Xingwei, et al.
Publicado: (2025)
NoLACE: Improving Low-Complexity Speech Codec Enhancement Through Adaptive Temporal Shaping
por: Büthe, Jan, et al.
Publicado: (2023)
por: Büthe, Jan, et al.
Publicado: (2023)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
por: Cui, Zhongjian, et al.
Publicado: (2025)
por: Cui, Zhongjian, et al.
Publicado: (2025)
SaD: A Scenario-Aware Discriminator for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
por: Wang, Jiahe, et al.
Publicado: (2025)
por: Wang, Jiahe, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
por: Nasretdinov, Rauf, et al.
Publicado: (2025)
Ejemplares similares
-
UL-UNAS: Ultra-Lightweight U-Nets for Real-Time Speech Enhancement via Network Architecture Search
por: Rong, Xiaobin, et al.
Publicado: (2025) -
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026) -
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
por: Wang, Dahan, et al.
Publicado: (2026) -
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025) -
TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network
por: Rong, Xiaobin, et al.
Publicado: (2025)