Unsupervised Face-Masked Speech Enhancement Using Generative Adversarial Networks With Human-in-the-Loop Assessment Metrics
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Syu-Siang, Chen, Jia-Yang, Bai, Bo-Ren, Fang, Shih-Hau, Tsao, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Study on Speech Assessment with Visual Cues
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
di: Ahmed, Shafique, et al.
Pubblicazione: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
di: Wang, Ziqian, et al.
Pubblicazione: (2023)
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024)
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Speech Enhancement based on cascaded two flows
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
USDnet: Unsupervised Speech Dereverberation via Neural Forward Filtering
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
FlowSE: Flow Matching-based Speech Enhancement
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
di: Lee, Dongheon, et al.
Pubblicazione: (2023)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
HyBeam: Hybrid Microphone-Beamforming Array-Agnostic Speech Enhancement for Wearables
di: Ilan, Yuval Bar, et al.
Pubblicazione: (2025)
di: Ilan, Yuval Bar, et al.
Pubblicazione: (2025)
Toward Universal Speech Enhancement for Diverse Input Conditions
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
SuperM2M: Supervised and Mixture-to-Mixture Co-Learning for Speech Enhancement and Noise-Robust ASR
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
PLDNet: PLD-Guided Lightweight Deep Network Boosted by Efficient Attention for Handheld Dual-Microphone Speech Enhancement
di: Zhou, Nan, et al.
Pubblicazione: (2024)
di: Zhou, Nan, et al.
Pubblicazione: (2024)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
di: Haeb-Umbach, Reinhold, et al.
Pubblicazione: (2025)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
di: Sato, Hiroshi, et al.
Pubblicazione: (2025)
Contrastive Knowledge Distillation for Embedding Refinement in Personalized Speech Enhancement
di: Serre, Thomas, et al.
Pubblicazione: (2026)
di: Serre, Thomas, et al.
Pubblicazione: (2026)
Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
Advanced Signal Analysis in Detecting Replay Attacks for Automatic Speaker Verification Systems
di: Kuang, Lee Shih
Pubblicazione: (2024)
di: Kuang, Lee Shih
Pubblicazione: (2024)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection
di: Ren, Wenze, et al.
Pubblicazione: (2026)
di: Ren, Wenze, et al.
Pubblicazione: (2026)
Unsupervised Variational Acoustic Clustering
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
di: Fiorio, Luan Vinícius, et al.
Pubblicazione: (2025)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
di: Ren, Yanzhou, et al.
Pubblicazione: (2026)
di: Ren, Yanzhou, et al.
Pubblicazione: (2026)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
di: Yan, Haoyin, et al.
Pubblicazione: (2024)
A Speech Production Model for Radar: Connecting Speech Acoustics with Radar-Measured Vibrations
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
di: Lenz, Isabella, et al.
Pubblicazione: (2025)
ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Unsupervised detection and classification of heartbeats using the dissimilarity matrix in PCG signals
di: Torre-Cruz, J., et al.
Pubblicazione: (2024)
di: Torre-Cruz, J., et al.
Pubblicazione: (2024)
Binaural Localization Model for Speech in Noise
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
di: Tokala, Vikas, et al.
Pubblicazione: (2025)
Speech-Based Prioritization for Schizophrenia Intervention
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
di: Premananth, Gowtham, et al.
Pubblicazione: (2025)
Prompt-driven Target Speech Diarization
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
di: Jiang, Yidi, et al.
Pubblicazione: (2023)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
di: Hao, Xiang, et al.
Pubblicazione: (2020)
di: Hao, Xiang, et al.
Pubblicazione: (2020)
Brain-Informed Speech Separation for Cochlear Implants
di: Gajecki, Tom, et al.
Pubblicazione: (2026)
di: Gajecki, Tom, et al.
Pubblicazione: (2026)
From Evaluation to Optimization: Neural Speech Assessment for Downstream Applications
di: Tsao, Yu
Pubblicazione: (2025)
di: Tsao, Yu
Pubblicazione: (2025)
Transferable Selective Virtual Sensing Active Noise Control Technique Based on Metric Learning
di: Wang, Boxiang, et al.
Pubblicazione: (2024)
di: Wang, Boxiang, et al.
Pubblicazione: (2024)
Speech Enhancement Based on Drifting Models
di: Xu, Liang, et al.
Pubblicazione: (2026)
di: Xu, Liang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Study on Speech Assessment with Visual Cues
di: Ahmed, Shafique, et al.
Pubblicazione: (2025) -
SELM: Speech Enhancement Using Discrete Tokens and Language Models
di: Wang, Ziqian, et al.
Pubblicazione: (2023) -
Binaural Speech Enhancement Using Complex Convolutional Recurrent Networks
di: Tokala, Vikas, et al.
Pubblicazione: (2025) -
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
di: Wang, Kuan-Chen, et al.
Pubblicazione: (2024) -
TTSlow: Slow Down Text-to-Speech with Efficiency Robustness Evaluations
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)