UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
Fuente:
arXiv
Salvato in:
| Autori principali: | Gupta, Kishan, Korse, Srikanth, Brendel, Andreas, Pia, Nicola, Fuchs, Guillaume |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On Improving Error Resilience of Neural End-to-End Speech Coders
di: Gupta, Kishan, et al.
Pubblicazione: (2024)
di: Gupta, Kishan, et al.
Pubblicazione: (2024)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
di: Gupta, Kishan, et al.
Pubblicazione: (2022)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
di: Brendel, Andreas, et al.
Pubblicazione: (2024)
di: Brendel, Andreas, et al.
Pubblicazione: (2024)
Stereo Reproduction in the Presence of Sample Rate Offsets
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
di: Eichenseer, Andrea, et al.
Pubblicazione: (2025)
di: Eichenseer, Andrea, et al.
Pubblicazione: (2025)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
di: Fang, Yuan, et al.
Pubblicazione: (2024)
di: Fang, Yuan, et al.
Pubblicazione: (2024)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
On the Design of Diffusion-based Neural Speech Codecs
di: Foti, Pietro, et al.
Pubblicazione: (2025)
di: Foti, Pietro, et al.
Pubblicazione: (2025)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capture
di: Hauret, Julien, et al.
Pubblicazione: (2023)
di: Hauret, Julien, et al.
Pubblicazione: (2023)
Attention-Guided Adaptation for Code-Switching Speech Recognition
di: Aditya, Bobbi, et al.
Pubblicazione: (2023)
di: Aditya, Bobbi, et al.
Pubblicazione: (2023)
Comparative Analysis Of Discriminative Deep Learning-Based Noise Reduction Methods In Low SNR Scenarios
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2024)
Fast and Flexible Audio Bandwidth Extension via Vocos
di: Sharma, Yatharth
Pubblicazione: (2026)
di: Sharma, Yatharth
Pubblicazione: (2026)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
BERP: A Blind Estimator of Room Parameters for Single-Channel Noisy Speech Signals
di: Wang, Lijun, et al.
Pubblicazione: (2024)
di: Wang, Lijun, et al.
Pubblicazione: (2024)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
SpatialCodec: Neural Spatial Speech Coding
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2023)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2023)
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
di: Pia, Nicola, et al.
Pubblicazione: (2024)
di: Pia, Nicola, et al.
Pubblicazione: (2024)
Vision-Integrated High-Quality Neural Speech Coding
di: Guo, Yao, et al.
Pubblicazione: (2025)
di: Guo, Yao, et al.
Pubblicazione: (2025)
Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models
di: Jing, Xin, et al.
Pubblicazione: (2024)
di: Jing, Xin, et al.
Pubblicazione: (2024)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
di: Liang, Ziqi, et al.
Pubblicazione: (2024)
Fewer-token Neural Speech Codec with Time-invariant Codes
di: Ren, Yong, et al.
Pubblicazione: (2023)
di: Ren, Yong, et al.
Pubblicazione: (2023)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
Efficient Sparse Coding with the Adaptive Locally Competitive Algorithm for Speech Classification
di: Bahadi, Soufiyan, et al.
Pubblicazione: (2024)
di: Bahadi, Soufiyan, et al.
Pubblicazione: (2024)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024)
di: Giraldo, José, et al.
Pubblicazione: (2024)
Speech Bandwidth Expansion Via High Fidelity Generative Adversarial Networks
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
di: Salhab, Mahmoud, et al.
Pubblicazione: (2024)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2025)
di: Dai, Wang, et al.
Pubblicazione: (2025)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
di: Chae, Yunkee, et al.
Pubblicazione: (2025)
di: Chae, Yunkee, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On Improving Error Resilience of Neural End-to-End Speech Coders
di: Gupta, Kishan, et al.
Pubblicazione: (2024) -
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
di: Gupta, Kishan, et al.
Pubblicazione: (2022) -
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
di: Brendel, Andreas, et al.
Pubblicazione: (2024) -
Stereo Reproduction in the Presence of Sample Rate Offsets
di: Korse, Srikanth, et al.
Pubblicazione: (2025) -
Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
di: Eichenseer, Andrea, et al.
Pubblicazione: (2025)