StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Rong, Xiaobin, Gao, Jun, Wang, Zheng, Yesilbursa, Mansur, Wojcicki, Kamil, Lu, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
por: Mack, Wolfgang, et al.
Publicado: (2025)
por: Mack, Wolfgang, et al.
Publicado: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
por: Wang, Zheng, et al.
Publicado: (2025)
por: Wang, Zheng, et al.
Publicado: (2025)
Crowdsourced Multilingual Speech Intelligibility Testing
por: Lechler, Laura, et al.
Publicado: (2024)
por: Lechler, Laura, et al.
Publicado: (2024)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
por: Wojcicki, Kamil, et al.
Publicado: (2025)
por: Wojcicki, Kamil, et al.
Publicado: (2025)
Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation
por: Wang, Zheng, et al.
Publicado: (2026)
por: Wang, Zheng, et al.
Publicado: (2026)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
UL-UNAS: Ultra-Lightweight U-Nets for Real-Time Speech Enhancement via Network Architecture Search
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
por: Wang, Dahan, et al.
Publicado: (2026)
por: Wang, Dahan, et al.
Publicado: (2026)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Hallucination in Perceptual Metric-Driven Speech Enhancement Networks
por: Close, George, et al.
Publicado: (2024)
por: Close, George, et al.
Publicado: (2024)
SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement
por: Hou, Zhongshu, et al.
Publicado: (2024)
por: Hou, Zhongshu, et al.
Publicado: (2024)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
por: Kuhlmann, Michael, et al.
Publicado: (2026)
por: Kuhlmann, Michael, et al.
Publicado: (2026)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
FNSE-SBGAN: Far-field Speech Enhancement with Schrodinger Bridge and Generative Adversarial Networks
por: Lei, Tong, et al.
Publicado: (2025)
por: Lei, Tong, et al.
Publicado: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Schrödinger Bridge for Generative Speech Enhancement
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
por: Lu, Ye-Xin, et al.
Publicado: (2023)
por: Lu, Ye-Xin, et al.
Publicado: (2023)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
por: Yang, Leyan, et al.
Publicado: (2026)
por: Yang, Leyan, et al.
Publicado: (2026)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
Towards Ultra-Low-Power Neuromorphic Speech Enhancement with Spiking-FullSubNet
por: Hao, Xiang, et al.
Publicado: (2024)
por: Hao, Xiang, et al.
Publicado: (2024)
Complex Recurrent Variational Autoencoder with Application to Speech Enhancement
por: Xie, Yuying, et al.
Publicado: (2022)
por: Xie, Yuying, et al.
Publicado: (2022)
Exploring Length Generalization For Transformer-based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
por: Zhao, Shengkui, et al.
Publicado: (2025)
por: Zhao, Shengkui, et al.
Publicado: (2025)
Towards Frame-level Quality Predictions of Synthetic Speech
por: Kuhlmann, Michael, et al.
Publicado: (2025)
por: Kuhlmann, Michael, et al.
Publicado: (2025)
French Listening Tests for the Assessment of Intelligibility, Quality, and Identity of Body-Conducted Speech Enhancement
por: Joubaud, Thomas, et al.
Publicado: (2025)
por: Joubaud, Thomas, et al.
Publicado: (2025)
From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding
por: Yi, Jayeon, et al.
Publicado: (2026)
por: Yi, Jayeon, et al.
Publicado: (2026)
FastEnhancer: Speed-Optimized Streaming Neural Speech Enhancement
por: Ahn, Sunghwan, et al.
Publicado: (2025)
por: Ahn, Sunghwan, et al.
Publicado: (2025)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
por: Liu, Yinghao, et al.
Publicado: (2026)
por: Liu, Yinghao, et al.
Publicado: (2026)
MeanSE: Efficient Generative Speech Enhancement with Mean Flows
por: Wang, Jiahe, et al.
Publicado: (2025)
por: Wang, Jiahe, et al.
Publicado: (2025)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Zhou, Rui, et al.
Publicado: (2024)
por: Zhou, Rui, et al.
Publicado: (2024)
Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework
por: Yang, Hsiang-Cheng, et al.
Publicado: (2026)
por: Yang, Hsiang-Cheng, et al.
Publicado: (2026)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Influence of Clean Speech Characteristics on Speech Enhancement Performance
por: Hou, Mingchi, et al.
Publicado: (2025)
por: Hou, Mingchi, et al.
Publicado: (2025)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
por: Shechtman, Slava, et al.
Publicado: (2024)
por: Shechtman, Slava, et al.
Publicado: (2024)
Ejemplares similares
-
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2025) -
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
por: Rong, Xiaobin, et al.
Publicado: (2026) -
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
por: Mack, Wolfgang, et al.
Publicado: (2025) -
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026) -
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
por: Wang, Zheng, et al.
Publicado: (2025)