CMGAN: Conformer-based Metric GAN for Speech Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Ruizhe, Abdulatif, Sherif, Yang, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
por: Abdulatif, Sherif, et al.
Publicado: (2022)
por: Abdulatif, Sherif, et al.
Publicado: (2022)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025)
por: Wen, Bin, et al.
Publicado: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Schrödinger Bridge Mamba for One-Step Speech Enhancement
por: Yang, Jing, et al.
Publicado: (2025)
por: Yang, Jing, et al.
Publicado: (2025)
Pre-training Feature Guided Diffusion Model for Speech Enhancement
por: Yang, Yiyuan, et al.
Publicado: (2024)
por: Yang, Yiyuan, et al.
Publicado: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
por: Fu, Szu-Wei, et al.
Publicado: (2024)
por: Fu, Szu-Wei, et al.
Publicado: (2024)
Single and Few-step Diffusion for Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2023)
por: Lay, Bunlong, et al.
Publicado: (2023)
Compose Yourself: Average-Velocity Flow Matching for One-Step Speech Enhancement
por: Yang, Gang, et al.
Publicado: (2025)
por: Yang, Gang, et al.
Publicado: (2025)
Alternating Approach-Putt Models for Multi-Stage Speech Enhancement
por: Jeong, Iksoon, et al.
Publicado: (2025)
por: Jeong, Iksoon, et al.
Publicado: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
por: Zhang, Shiqi, et al.
Publicado: (2024)
por: Zhang, Shiqi, et al.
Publicado: (2024)
Personalized Speech Enhancement Without a Separate Speaker Embedding Model
por: Pärnamaa, Tanel, et al.
Publicado: (2024)
por: Pärnamaa, Tanel, et al.
Publicado: (2024)
Towards Lightweight Adaptation of Speech Enhancement Models in Real-World Environments
por: Cheng, Longbiao, et al.
Publicado: (2026)
por: Cheng, Longbiao, et al.
Publicado: (2026)
aTENNuate: Optimized Real-time Speech Enhancement with Deep SSMs on Raw Audio
por: Pei, Yan Ru, et al.
Publicado: (2024)
por: Pei, Yan Ru, et al.
Publicado: (2024)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Mitigating Unauthorized Speech Synthesis for Voice Protection
por: Zhang, Zhisheng, et al.
Publicado: (2024)
por: Zhang, Zhisheng, et al.
Publicado: (2024)
When De-noising Hurts: A Systematic Study of Speech Enhancement Effects on Modern Medical ASR Systems
por: Chondhekar, Sujal, et al.
Publicado: (2025)
por: Chondhekar, Sujal, et al.
Publicado: (2025)
TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable Platforms
por: Sui, Yueyuan, et al.
Publicado: (2024)
por: Sui, Yueyuan, et al.
Publicado: (2024)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
por: Wu, Linzhi, et al.
Publicado: (2026)
por: Wu, Linzhi, et al.
Publicado: (2026)
EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance
por: Hussain, Shehzeen, et al.
Publicado: (2025)
por: Hussain, Shehzeen, et al.
Publicado: (2025)
Self-Supervised Disentangled Representation Learning for Robust Target Speech Extraction
por: Mu, Zhaoxi, et al.
Publicado: (2023)
por: Mu, Zhaoxi, et al.
Publicado: (2023)
DCTX-Conformer: Dynamic context carry-over for low latency unified streaming and non-streaming Conformer ASR
por: Huybrechts, Goeric, et al.
Publicado: (2023)
por: Huybrechts, Goeric, et al.
Publicado: (2023)
Focal Loss based Residual Convolutional Neural Network for Speech Emotion Recognition
por: Tripathi, Suraj, et al.
Publicado: (2019)
por: Tripathi, Suraj, et al.
Publicado: (2019)
Speech Unlearning
por: Cheng, Jiali, et al.
Publicado: (2025)
por: Cheng, Jiali, et al.
Publicado: (2025)
DiffEditor: Enhancing Speech Editing with Semantic Enrichment and Acoustic Consistency
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Collaborative Watermarking for Adversarial Speech Synthesis
por: Juvela, Lauri, et al.
Publicado: (2023)
por: Juvela, Lauri, et al.
Publicado: (2023)
Scaling Speech Tokenizers with Diffusion Autoencoders
por: Wang, Yuancheng, et al.
Publicado: (2026)
por: Wang, Yuancheng, et al.
Publicado: (2026)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
por: Chung, Yoonjin, et al.
Publicado: (2025)
por: Chung, Yoonjin, et al.
Publicado: (2025)
An Analysis of the Variance of Diffusion-based Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
An Investigation of Incorporating Mamba for Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2024)
por: Chao, Rong, et al.
Publicado: (2024)
CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models
por: Du, Zhihao, et al.
Publicado: (2024)
por: Du, Zhihao, et al.
Publicado: (2024)
High-Resolution Speech Restoration with Latent Diffusion Model
por: Dhyani, Tushar, et al.
Publicado: (2024)
por: Dhyani, Tushar, et al.
Publicado: (2024)
JenGAN: Stacked Shifted Filters in GAN-Based Speech Synthesis
por: Cho, Hyunjae, et al.
Publicado: (2024)
por: Cho, Hyunjae, et al.
Publicado: (2024)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Investigating the Effectiveness of Explainability Methods in Parkinson's Detection from Speech
por: Mancini, Eleonora, et al.
Publicado: (2024)
por: Mancini, Eleonora, et al.
Publicado: (2024)
Imagined Speech State Classification for Robust Brain-Computer Interface
por: Ko, Byung-Kwan, et al.
Publicado: (2024)
por: Ko, Byung-Kwan, et al.
Publicado: (2024)
Ejemplares similares
-
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
por: Abdulatif, Sherif, et al.
Publicado: (2022) -
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025) -
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025) -
Schrödinger Bridge Mamba for One-Step Speech Enhancement
por: Yang, Jing, et al.
Publicado: (2025) -
Pre-training Feature Guided Diffusion Model for Speech Enhancement
por: Yang, Yiyuan, et al.
Publicado: (2024)