Vector Quantized Diffusion Model Based Speech Bandwidth Extension
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Yuan, Bai, Jinglin, Wang, Jiajie, Zhang, Xueliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Two-Stage Band-Split Mamba-2 Network For Music Separation
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
di: Bai, Jinglin, et al.
Pubblicazione: (2024)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
di: Gupta, Kishan, et al.
Pubblicazione: (2025)
di: Gupta, Kishan, et al.
Pubblicazione: (2025)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
di: Zhao, Changjiang, et al.
Pubblicazione: (2024)
di: Zhao, Changjiang, et al.
Pubblicazione: (2024)
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
di: Tamiti, Tarikul Islam, et al.
Pubblicazione: (2025)
Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
di: Gu, Yuzhe, et al.
Pubblicazione: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
Multi-Channel Acoustic Echo Cancellation Based on Direction-of-Arrival Estimation
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capture
di: Hauret, Julien, et al.
Pubblicazione: (2023)
di: Hauret, Julien, et al.
Pubblicazione: (2023)
Autoregressive Speech Synthesis without Vector Quantization
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
di: Ding, Shaojin, et al.
Pubblicazione: (2023)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
di: Zhou, Junzuo, et al.
Pubblicazione: (2024)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
EDSep: An Effective Diffusion-Based Method for Speech Source Separation
di: Dong, Jinwei, et al.
Pubblicazione: (2025)
di: Dong, Jinwei, et al.
Pubblicazione: (2025)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
di: de Groot, Dimme, et al.
Pubblicazione: (2025)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
di: Jing, Ruihao, et al.
Pubblicazione: (2025)
Diffusion-Based Adversarial Purification for Speaker Verification
di: Bai, Yibo, et al.
Pubblicazione: (2023)
di: Bai, Yibo, et al.
Pubblicazione: (2023)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
di: Richter, Julius, et al.
Pubblicazione: (2025)
di: Richter, Julius, et al.
Pubblicazione: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
di: Chen, Yushen, et al.
Pubblicazione: (2025)
di: Chen, Yushen, et al.
Pubblicazione: (2025)
Fast and Flexible Audio Bandwidth Extension via Vocos
di: Sharma, Yatharth
Pubblicazione: (2026)
di: Sharma, Yatharth
Pubblicazione: (2026)
Composer Style-specific Symbolic Music Generation Using Vector Quantized Discrete Diffusion Models
di: Zhang, Jincheng, et al.
Pubblicazione: (2023)
di: Zhang, Jincheng, et al.
Pubblicazione: (2023)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
Robust Target Speaker Direction of Arrival Estimation
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
Room Impulse Response as a Prompt for Acoustic Echo Cancellation
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
di: Zhao, Shengkui, et al.
Pubblicazione: (2025)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
di: Sakpiboonchit, Siratish
Pubblicazione: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
DIFFRENT: A Diffusion Model for Recording Environment Transfer of Speech
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
Complex-Cycle-Consistent Diffusion Model for Monaural Speech Enhancement
di: Li, Yi, et al.
Pubblicazione: (2024)
di: Li, Yi, et al.
Pubblicazione: (2024)
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Two-Stage Band-Split Mamba-2 Network For Music Separation
di: Bai, Jinglin, et al.
Pubblicazione: (2024) -
Attention-Based Beamformer For Multi-Channel Speech Enhancement
di: Bai, Jinglin, et al.
Pubblicazione: (2024) -
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
di: Gupta, Kishan, et al.
Pubblicazione: (2025) -
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024) -
SICRN: Advancing Speech Enhancement through State Space Model and Inplace Convolution Techniques
di: Zhao, Changjiang, et al.
Pubblicazione: (2024)