From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yi, Jayeon, Kim, Minje |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SPG-Codec: Exploring the Role and Boundaries of Semantic Priors in Ultra-Low-Bitrate Neural Speech Coding
por: Zhao, Mingyu, et al.
Publicado: (2026)
por: Zhao, Mingyu, et al.
Publicado: (2026)
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
por: Ren, Yanzhou, et al.
Publicado: (2026)
por: Ren, Yanzhou, et al.
Publicado: (2026)
Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction
por: Du, Hui-Peng, et al.
Publicado: (2026)
por: Du, Hui-Peng, et al.
Publicado: (2026)
Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
por: Hsieh, Tsun-An, et al.
Publicado: (2024)
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
por: Kim, Minje, et al.
Publicado: (2024)
por: Kim, Minje, et al.
Publicado: (2024)
CodeSep: Low-Bitrate Codec-Driven Speech Separation with Base-Token Disentanglement and Auxiliary-Token Serial Prediction
por: Du, Hui-Peng, et al.
Publicado: (2026)
por: Du, Hui-Peng, et al.
Publicado: (2026)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)
por: Chae, Yunkee, et al.
Publicado: (2025)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
por: Yang, Leyan, et al.
Publicado: (2026)
por: Yang, Leyan, et al.
Publicado: (2026)
Hyperbolic Distance-Based Speech Separation
por: Petermann, Darius, et al.
Publicado: (2024)
por: Petermann, Darius, et al.
Publicado: (2024)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
por: Shechtman, Slava, et al.
Publicado: (2024)
por: Shechtman, Slava, et al.
Publicado: (2024)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
por: Brendel, Andreas, et al.
Publicado: (2024)
por: Brendel, Andreas, et al.
Publicado: (2024)
Personalized Neural Speech Codec
por: Jang, Inseon, et al.
Publicado: (2024)
por: Jang, Inseon, et al.
Publicado: (2024)
Optimizing Neural Speech Codec for Low-Bitrate Compression via Multi-Scale Encoding
por: Yang, Peiji, et al.
Publicado: (2024)
por: Yang, Peiji, et al.
Publicado: (2024)
MuCodec: Ultra Low-Bitrate Music Codec
por: Xu, Yaoxun, et al.
Publicado: (2024)
por: Xu, Yaoxun, et al.
Publicado: (2024)
DDD: A Perceptually Superior Low-Response-Time DNN-based Declipper
por: Yi, Jayeon, et al.
Publicado: (2024)
por: Yi, Jayeon, et al.
Publicado: (2024)
CFMDCTCodec: A Low-Bitrate Neural Speech Codec with Noise-Prior-aware Conditional Flow Matching for MDCT-Spectral Enhancement
por: Jiang, Xiao-Hang, et al.
Publicado: (2026)
por: Jiang, Xiao-Hang, et al.
Publicado: (2026)
Perceptual Audio Coding: A 40-Year Historical Perspective
por: Herre, Jürgen, et al.
Publicado: (2025)
por: Herre, Jürgen, et al.
Publicado: (2025)
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Scaling Transformers for Low-Bitrate High-Quality Speech Coding
por: Parker, Julian D, et al.
Publicado: (2024)
por: Parker, Julian D, et al.
Publicado: (2024)
MSR-Codec: A Low-Bitrate Multi-Stream Residual Codec for High-Fidelity Speech Generation with Information Disentanglement
por: Li, Jingyu, et al.
Publicado: (2025)
por: Li, Jingyu, et al.
Publicado: (2025)
Universal Speech Token Learning via Low-Bitrate Neural Codec and Pretrained Representations
por: Jiang, Xue, et al.
Publicado: (2025)
por: Jiang, Xue, et al.
Publicado: (2025)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
A Comparative Analysis of Poetry Reading Audio: Singing, Narrating, or Somewhere In Between?
por: Choi, Kahyun, et al.
Publicado: (2024)
por: Choi, Kahyun, et al.
Publicado: (2024)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
por: Tian, Yusheng, et al.
Publicado: (2024)
por: Tian, Yusheng, et al.
Publicado: (2024)
FocalCodec: Low-Bitrate Speech Coding via Focal Modulation Networks
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Hallucination in Perceptual Metric-Driven Speech Enhancement Networks
por: Close, George, et al.
Publicado: (2024)
por: Close, George, et al.
Publicado: (2024)
StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
por: Gong, Yitian, et al.
Publicado: (2025)
por: Gong, Yitian, et al.
Publicado: (2025)
FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
por: Della Libera, Luca, et al.
Publicado: (2025)
por: Della Libera, Luca, et al.
Publicado: (2025)
Combolutional Neural Networks
por: Churchwell, Cameron, et al.
Publicado: (2025)
por: Churchwell, Cameron, et al.
Publicado: (2025)
PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2025)
por: Rong, Xiaobin, et al.
Publicado: (2025)
SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound
por: Liu, Haohe, et al.
Publicado: (2024)
por: Liu, Haohe, et al.
Publicado: (2024)
Speech Separation using Neural Audio Codecs with Embedding Loss
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
por: Lin, Jackie, et al.
Publicado: (2026)
por: Lin, Jackie, et al.
Publicado: (2026)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
por: Liu, Hexin, et al.
Publicado: (2024)
por: Liu, Hexin, et al.
Publicado: (2024)
Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine
por: Kuznetsova, Anastasia, et al.
Publicado: (2025)
por: Kuznetsova, Anastasia, et al.
Publicado: (2025)
MDCTCodec: A Lightweight MDCT-based Neural Audio Codec towards High Sampling Rate and Low Bitrate Scenarios
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
Ejemplares similares
-
SPG-Codec: Exploring the Role and Boundaries of Semantic Priors in Ultra-Low-Bitrate Neural Speech Coding
por: Zhao, Mingyu, et al.
Publicado: (2026) -
Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec
por: Ren, Yanzhou, et al.
Publicado: (2026) -
Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction
por: Du, Hui-Peng, et al.
Publicado: (2026) -
Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
por: Hsieh, Tsun-An, et al.
Publicado: (2024) -
Neural Speech and Audio Coding: Modern AI Technology Meets Traditional Codecs
por: Kim, Minje, et al.
Publicado: (2024)