Towards High-Quality and Efficient Speech Bandwidth Extension with Parallel Amplitude and Phase Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Ye-Xin, Ai, Yang, Du, Hui-Peng, Ling, Zhen-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023)
par: Lu, Ye-Xin, et autres
Publié: (2023)
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
par: Liu, Fei, et autres
Publié: (2024)
par: Liu, Fei, et autres
Publié: (2024)
Pitch-and-Spectrum-Aware Singing Quality Assessment with Bias Correction and Model Fusion
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models
par: Yang, Ningyuan, et autres
Publié: (2026)
par: Yang, Ningyuan, et autres
Publié: (2026)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
Universal Preference-Score-based Pairwise Speech Quality Assessment
par: Shi, Yu-Fei, et autres
Publié: (2025)
par: Shi, Yu-Fei, et autres
Publié: (2025)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
Semantic Communications for Speech Recognition
par: Weng, Zhenzi, et autres
Publié: (2021)
par: Weng, Zhenzi, et autres
Publié: (2021)
Toward Universal Speech Enhancement for Diverse Input Conditions
par: Zhang, Wangyou, et autres
Publié: (2023)
par: Zhang, Wangyou, et autres
Publié: (2023)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025)
par: Gong, Xun, et autres
Publié: (2025)
A Robust Method for Pitch Tracking in the Frequency Following Response using Harmonic Amplitude Summation Filterbank
par: Sadeghkhani, Sajad, et autres
Publié: (2025)
par: Sadeghkhani, Sajad, et autres
Publié: (2025)
APCodec+: A Spectrum-Coding-Based High-Fidelity and High-Compression-Rate Neural Audio Codec with Staged Training Paradigm
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
A Distilled Low-Latency Neural Vocoder with Explicit Amplitude and Phase Prediction
par: Du, Hui-Peng, et autres
Publié: (2025)
par: Du, Hui-Peng, et autres
Publié: (2025)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
par: Qi, Tianhua, et autres
Publié: (2026)
par: Qi, Tianhua, et autres
Publié: (2026)
Towards Improved Objective Perceptual Audio Quality Assessment -- Part 1: A Novel Data-Driven Cognitive Model
par: Delgado, Pablo M., et autres
Publié: (2024)
par: Delgado, Pablo M., et autres
Publié: (2024)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
Dynamic Prediction of Full-Ocean Depth SSP by Hierarchical LSTM: An Experimental Result
par: Lu, Jiajun, et autres
Publié: (2023)
par: Lu, Jiajun, et autres
Publié: (2023)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
par: Gupta, Kishan, et autres
Publié: (2025)
par: Gupta, Kishan, et autres
Publié: (2025)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024)
par: Fang, Yuan, et autres
Publié: (2024)
A Study on Speech Assessment with Visual Cues
par: Ahmed, Shafique, et autres
Publié: (2025)
par: Ahmed, Shafique, et autres
Publié: (2025)
Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity
par: Qi, Tianhua, et autres
Publié: (2024)
par: Qi, Tianhua, et autres
Publié: (2024)
STNet: Prediction of Underwater Sound Speed Profiles with An Advanced Semi-Transformer Neural Network
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Speech dereverberation constrained on room impulse response characteristics
par: Bahrman, Louis, et autres
Publié: (2024)
par: Bahrman, Louis, et autres
Publié: (2024)
Relating the Neural Representations of Vocalized, Mimed, and Imagined Speech
par: Maghsoudi, Maryam, et autres
Publié: (2026)
par: Maghsoudi, Maryam, et autres
Publié: (2026)
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
par: Joysingh, S. Johanan, et autres
Publié: (2024)
par: Joysingh, S. Johanan, et autres
Publié: (2024)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
par: Haeb-Umbach, Reinhold, et autres
Publié: (2025)
par: Haeb-Umbach, Reinhold, et autres
Publié: (2025)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
par: Premananth, Gowtham, et autres
Publié: (2024)
par: Premananth, Gowtham, et autres
Publié: (2024)
On Improving Error Resilience of Neural End-to-End Speech Coders
par: Gupta, Kishan, et autres
Publié: (2024)
par: Gupta, Kishan, et autres
Publié: (2024)
Conditioning and Sampling in Variational Diffusion Models for Speech Super-Resolution
par: Yu, Chin-Yun, et autres
Publié: (2022)
par: Yu, Chin-Yun, et autres
Publié: (2022)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
par: Zhang, Wangyou, et autres
Publié: (2025)
par: Zhang, Wangyou, et autres
Publié: (2025)
Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation
par: Rahimi, Akam, et autres
Publié: (2025)
par: Rahimi, Akam, et autres
Publié: (2025)
Documents similaires
-
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
par: Lu, Ye-Xin, et autres
Publié: (2023) -
APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding
par: Ai, Yang, et autres
Publié: (2024) -
Multi-Stage Speech Bandwidth Extension with Flexible Sampling Rate Control
par: Lu, Ye-Xin, et autres
Publié: (2024) -
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
par: Du, Hui-Peng, et autres
Publié: (2024) -
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)