PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Rong, Xiaobin, Hu, Qinwen, Yesilbursa, Mansur, Wojcicki, Kamil, Lu, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Adapting WavLM for Speech Emotion Recognition
por: Diatlova, Daria, et al.
Publicado: (2024)
por: Diatlova, Daria, et al.
Publicado: (2024)
WavLM model ensemble for audio deepfake detection
por: Combei, David, et al.
Publicado: (2024)
por: Combei, David, et al.
Publicado: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
por: Lin, Jingru, et al.
Publicado: (2024)
por: Lin, Jingru, et al.
Publicado: (2024)
Exploring WavLM Back-ends for Speech Spoofing and Deepfake Detection
por: Stourbe, Theophile, et al.
Publicado: (2024)
por: Stourbe, Theophile, et al.
Publicado: (2024)
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
por: Mack, Wolfgang, et al.
Publicado: (2025)
por: Mack, Wolfgang, et al.
Publicado: (2025)
Audio Deepfake Detection with Self-Supervised WavLM and Multi-Fusion Attentive Classifier
por: Guo, Yinlin, et al.
Publicado: (2023)
por: Guo, Yinlin, et al.
Publicado: (2023)
Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech
por: Nakazawa, Kazushi
Publicado: (2026)
por: Nakazawa, Kazushi
Publicado: (2026)
Reducing Linguistic Hallucination in LM-Based Speech Enhancement via Noise-Invariant Acoustic-Semantic Distillation
por: Wang, Zheng, et al.
Publicado: (2026)
por: Wang, Zheng, et al.
Publicado: (2026)
TS-URGENet: A Three-stage Universal Robust and Generalizable Speech Enhancement Network
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM
por: Sun, Zhaokai, et al.
Publicado: (2025)
por: Sun, Zhaokai, et al.
Publicado: (2025)
XWSB: A Blend System Utilizing XLS-R and WavLM with SLS Classifier detection system for SVDD 2024 Challenge
por: Zhang, Qishan, et al.
Publicado: (2024)
por: Zhang, Qishan, et al.
Publicado: (2024)
SNR-Progressive Model with Harmonic Compensation for Low-SNR Speech Enhancement
por: Hou, Zhongshu, et al.
Publicado: (2024)
por: Hou, Zhongshu, et al.
Publicado: (2024)
Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation
por: Ruggiero, Giuseppe, et al.
Publicado: (2025)
por: Ruggiero, Giuseppe, et al.
Publicado: (2025)
Crowdsourced Multilingual Speech Intelligibility Testing
por: Lechler, Laura, et al.
Publicado: (2024)
por: Lechler, Laura, et al.
Publicado: (2024)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
por: Wojcicki, Kamil, et al.
Publicado: (2025)
por: Wojcicki, Kamil, et al.
Publicado: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
por: Wang, Zheng, et al.
Publicado: (2025)
por: Wang, Zheng, et al.
Publicado: (2025)
FNSE-SBGAN: Far-field Speech Enhancement with Schrodinger Bridge and Generative Adversarial Networks
por: Lei, Tong, et al.
Publicado: (2025)
por: Lei, Tong, et al.
Publicado: (2025)
Adaptive Convolution for CNN-based Speech Enhancement Models
por: Wang, Dahan, et al.
Publicado: (2025)
por: Wang, Dahan, et al.
Publicado: (2025)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
por: Zhang, Fan, et al.
Publicado: (2023)
por: Zhang, Fan, et al.
Publicado: (2023)
UL-UNAS: Ultra-Lightweight U-Nets for Real-Time Speech Enhancement via Network Architecture Search
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
por: Kounadis-Bastian, Dionyssos, et al.
Publicado: (2024)
por: Kounadis-Bastian, Dionyssos, et al.
Publicado: (2024)
ProSE: Diffusion Priors for Speech Enhancement
por: Kumar, Sonal, et al.
Publicado: (2025)
por: Kumar, Sonal, et al.
Publicado: (2025)
Weakly Supervised Phonological Features for Pathological Speech Analysis
por: Thienpondt, Jenthe, et al.
Publicado: (2025)
por: Thienpondt, Jenthe, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
por: Wang, Dahan, et al.
Publicado: (2026)
por: Wang, Dahan, et al.
Publicado: (2026)
Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs
por: Pietroń, Marcin, et al.
Publicado: (2026)
por: Pietroń, Marcin, et al.
Publicado: (2026)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
por: Yang, Leyan, et al.
Publicado: (2026)
por: Yang, Leyan, et al.
Publicado: (2026)
Hallucination in Perceptual Metric-Driven Speech Enhancement Networks
por: Close, George, et al.
Publicado: (2024)
por: Close, George, et al.
Publicado: (2024)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Leveraging Discriminative Latent Representations for Conditioning GAN-Based Speech Enhancement
por: Shetu, Shrishti Saha, et al.
Publicado: (2025)
por: Shetu, Shrishti Saha, et al.
Publicado: (2025)
WavCraft: Audio Editing and Generation with Large Language Models
por: Liang, Jinhua, et al.
Publicado: (2024)
por: Liang, Jinhua, et al.
Publicado: (2024)
CFMDCTCodec: A Low-Bitrate Neural Speech Codec with Noise-Prior-aware Conditional Flow Matching for MDCT-Spectral Enhancement
por: Jiang, Xiao-Hang, et al.
Publicado: (2026)
por: Jiang, Xiao-Hang, et al.
Publicado: (2026)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Schrödinger Bridge for Generative Speech Enhancement
por: Jukić, Ante, et al.
Publicado: (2024)
por: Jukić, Ante, et al.
Publicado: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
por: Deng, Keqi, et al.
Publicado: (2024)
por: Deng, Keqi, et al.
Publicado: (2024)
Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
Ejemplares similares
-
StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026) -
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
por: Rong, Xiaobin, et al.
Publicado: (2026) -
Adapting WavLM for Speech Emotion Recognition
por: Diatlova, Daria, et al.
Publicado: (2024) -
WavLM model ensemble for audio deepfake detection
por: Combei, David, et al.
Publicado: (2024) -
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
por: Lin, Jingru, et al.
Publicado: (2024)