Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
Fuente:
arXiv
Guardado en:
| Autores principales: | Brendel, Andreas, Pia, Nicola, Gupta, Kishan, Behringer, Lyonel, Fuchs, Guillaume, Multrus, Markus |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Improving Error Resilience of Neural End-to-End Speech Coders
por: Gupta, Kishan, et al.
Publicado: (2024)
por: Gupta, Kishan, et al.
Publicado: (2024)
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
por: Gupta, Kishan, et al.
Publicado: (2025)
por: Gupta, Kishan, et al.
Publicado: (2025)
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
por: Pia, Nicola, et al.
Publicado: (2024)
por: Pia, Nicola, et al.
Publicado: (2024)
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
por: Gupta, Kishan, et al.
Publicado: (2022)
por: Gupta, Kishan, et al.
Publicado: (2022)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)
por: Chae, Yunkee, et al.
Publicado: (2025)
Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs
por: Behringer, Lyonel, et al.
Publicado: (2026)
por: Behringer, Lyonel, et al.
Publicado: (2026)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
Variable Bitrate Residual Vector Quantization for Audio Coding
por: Chae, Yunkee, et al.
Publicado: (2024)
por: Chae, Yunkee, et al.
Publicado: (2024)
On the Design of Diffusion-based Neural Speech Codecs
por: Foti, Pietro, et al.
Publicado: (2025)
por: Foti, Pietro, et al.
Publicado: (2025)
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
por: Yang, Peiji, et al.
Publicado: (2024)
por: Yang, Peiji, et al.
Publicado: (2024)
Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
por: Eichenseer, Andrea, et al.
Publicado: (2025)
por: Eichenseer, Andrea, et al.
Publicado: (2025)
Benchmarking Neural Speech Codec Intelligibility with SITool
por: Leschanowsky, Anna, et al.
Publicado: (2025)
por: Leschanowsky, Anna, et al.
Publicado: (2025)
Meta Learning Text-to-Speech Synthesis in over 7000 Languages
por: Lux, Florian, et al.
Publicado: (2024)
por: Lux, Florian, et al.
Publicado: (2024)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
por: Ranjan, Rishabh, et al.
Publicado: (2025)
por: Ranjan, Rishabh, et al.
Publicado: (2025)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
por: Gu, Yuzhe, et al.
Publicado: (2024)
por: Gu, Yuzhe, et al.
Publicado: (2024)
ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning
por: Wang, Junyi, et al.
Publicado: (2026)
por: Wang, Junyi, et al.
Publicado: (2026)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)
por: Chen, Wenxi, et al.
Publicado: (2025)
SpatialCodec: Neural Spatial Speech Coding
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
por: Xu, Zhongweiyang, et al.
Publicado: (2023)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
Vision-Integrated High-Quality Neural Speech Coding
por: Guo, Yao, et al.
Publicado: (2025)
por: Guo, Yao, et al.
Publicado: (2025)
MuCodec: Ultra Low-Bitrate Music Codec
por: Xu, Yaoxun, et al.
Publicado: (2024)
por: Xu, Yaoxun, et al.
Publicado: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
por: Tang, Yun, et al.
Publicado: (2025)
por: Tang, Yun, et al.
Publicado: (2025)
Fewer-token Neural Speech Codec with Time-invariant Codes
por: Ren, Yong, et al.
Publicado: (2023)
por: Ren, Yong, et al.
Publicado: (2023)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
por: Shetu, Shrishti Saha, et al.
Publicado: (2024)
por: Shetu, Shrishti Saha, et al.
Publicado: (2024)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Comparative Analysis Of Discriminative Deep Learning-Based Noise Reduction Methods In Low SNR Scenarios
por: Shetu, Shrishti Saha, et al.
Publicado: (2024)
por: Shetu, Shrishti Saha, et al.
Publicado: (2024)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
por: Wan, Zixiang, et al.
Publicado: (2025)
por: Wan, Zixiang, et al.
Publicado: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
por: Ding, Shaojin, et al.
Publicado: (2023)
por: Ding, Shaojin, et al.
Publicado: (2023)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
por: Fang, Yuan, et al.
Publicado: (2024)
por: Fang, Yuan, et al.
Publicado: (2024)
Scaling Transformers for Low-Bitrate High-Quality Speech Coding
por: Parker, Julian D, et al.
Publicado: (2024)
por: Parker, Julian D, et al.
Publicado: (2024)
Neural Vocoders as Speech Enhancers
por: Li, Andong, et al.
Publicado: (2025)
por: Li, Andong, et al.
Publicado: (2025)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
Direct Speech-to-Speech Neural Machine Translation: A Survey
por: Gupta, Mahendra, et al.
Publicado: (2024)
por: Gupta, Mahendra, et al.
Publicado: (2024)
Spectrogram Patch Codec: A 2D Block-Quantized VQ-VAE and HiFi-GAN for Neural Speech Coding
por: Chary, Luis Felipe, et al.
Publicado: (2025)
por: Chary, Luis Felipe, et al.
Publicado: (2025)
Ejemplares similares
-
On Improving Error Resilience of Neural End-to-End Speech Coders
por: Gupta, Kishan, et al.
Publicado: (2024) -
UBGAN: Enhancing Coded Speech with Blind and Guided Bandwidth Extension
por: Gupta, Kishan, et al.
Publicado: (2025) -
FlowMAC: Conditional Flow Matching for Audio Coding at Low Bit Rates
por: Pia, Nicola, et al.
Publicado: (2024) -
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
por: Gupta, Kishan, et al.
Publicado: (2022) -
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)