Universal Discrete-Domain Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Fei, Ai, Yang, Lu, Ye-Xin, Zheng, Rui-Chen, Du, Hui-Peng, Ling, Zhen-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
par: Liu, Fei, et autres
Publié: (2024)
par: Liu, Fei, et autres
Publié: (2024)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023)
par: Lu, Ye-Xin, et autres
Publié: (2023)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Universal Preference-Score-based Pairwise Speech Quality Assessment
par: Shi, Yu-Fei, et autres
Publié: (2025)
par: Shi, Yu-Fei, et autres
Publié: (2025)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
Pitch-and-Spectrum-Aware Singing Quality Assessment with Bias Correction and Model Fusion
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching
par: Liu, Fei, et autres
Publié: (2026)
par: Liu, Fei, et autres
Publié: (2026)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
ParaGSE: Parallel Generative Speech Enhancement with Group-Vector-Quantization-based Neural Speech Codec
par: Liu, Fei, et autres
Publié: (2026)
par: Liu, Fei, et autres
Publié: (2026)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding
par: Zheng, Rui-Chen, et autres
Publié: (2025)
par: Zheng, Rui-Chen, et autres
Publié: (2025)
A Streamable Neural Audio Codec with Residual Scalar-Vector Quantization for Real-Time Communication
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
UniVocal: Unified Speech-Singing Code-Switching Synthesis
par: Shi, Yufei, et autres
Publié: (2026)
par: Shi, Yufei, et autres
Publié: (2026)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
Absorbing Discrete Diffusion for Speech Enhancement
par: Gonzalez, Philippe
Publié: (2026)
par: Gonzalez, Philippe
Publié: (2026)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
par: Wang, Chien-Chun, et autres
Publié: (2026)
par: Wang, Chien-Chun, et autres
Publié: (2026)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
par: Rong, Xiaobin, et autres
Publié: (2026)
par: Rong, Xiaobin, et autres
Publié: (2026)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
par: Liu, Yinghao, et autres
Publié: (2026)
par: Liu, Yinghao, et autres
Publié: (2026)
Low-latency Speech Enhancement via Speech Token Generation
par: Xue, Huaying, et autres
Publié: (2023)
par: Xue, Huaying, et autres
Publié: (2023)
Rethinking Training Targets, Architectures and Data Quality for Universal Speech Enhancement
par: Fu, Szu-Wei, et autres
Publié: (2026)
par: Fu, Szu-Wei, et autres
Publié: (2026)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
par: Chen, Yanan, et autres
Publié: (2024)
par: Chen, Yanan, et autres
Publié: (2024)
DisSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration
par: Liang, Ziqi, et autres
Publié: (2026)
par: Liang, Ziqi, et autres
Publié: (2026)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Improving DF-Conformer Using Hydra For High-Fidelity Generative Speech Enhancement on Discrete Codec Token
par: Seki, Shogo, et autres
Publié: (2025)
par: Seki, Shogo, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
par: Shen, Feiyu, et autres
Publié: (2023)
par: Shen, Feiyu, et autres
Publié: (2023)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2026)
par: Chen, Youjun, et autres
Publié: (2026)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
par: Yamauchi, Kazuki, et autres
Publié: (2026)
par: Yamauchi, Kazuki, et autres
Publié: (2026)
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
Continuous Modeling of the Denoising Process for Speech Enhancement Based on Deep Learning
par: Guo, Zilu, et autres
Publié: (2023)
par: Guo, Zilu, et autres
Publié: (2023)
Universal Speech Enhancement with Regression and Generative Mamba
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
Documents similaires
-
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
par: Liu, Fei, et autres
Publié: (2024) -
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
par: Lu, Ye-Xin, et autres
Publié: (2025) -
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023) -
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
par: Lu, Ye-Xin, et autres
Publié: (2024) -
Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation
par: Liu, Fei, et autres
Publié: (2025)