Efficient Evaluation of Quantization-Effects in Neural Codecs
Fuente:
arXiv
Guardado en:
| Autores principales: | Mack, Wolfgang, Mustafa, Ahmed, Łaganowski, Rafał, Hijazy, Samer |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
por: Wojcicki, Kamil, et al.
Publicado: (2025)
por: Wojcicki, Kamil, et al.
Publicado: (2025)
SNAC: Multi-Scale Neural Audio Codec
por: Siuzdak, Hubert, et al.
Publicado: (2024)
por: Siuzdak, Hubert, et al.
Publicado: (2024)
RepCodec: A Speech Representation Codec for Speech Tokenization
por: Huang, Zhichao, et al.
Publicado: (2023)
por: Huang, Zhichao, et al.
Publicado: (2023)
Latent Granular Resynthesis using Neural Audio Codecs
por: Tokui, Nao, et al.
Publicado: (2025)
por: Tokui, Nao, et al.
Publicado: (2025)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
por: Nercessian, Shahan, et al.
Publicado: (2024)
por: Nercessian, Shahan, et al.
Publicado: (2024)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
A Closer Look at Neural Codec Resynthesis: Bridging the Gap between Codec and Waveform Generation
por: Liu, Alexander H., et al.
Publicado: (2024)
por: Liu, Alexander H., et al.
Publicado: (2024)
Enhancing Noise Robustness for Neural Speech Codecs through Resource-Efficient Progressive Quantization Perturbation Simulation
por: Zheng, Rui-Chen, et al.
Publicado: (2025)
por: Zheng, Rui-Chen, et al.
Publicado: (2025)
On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
por: Halimeh, Mhd Modar, et al.
Publicado: (2025)
Learning Source Disentanglement in Neural Audio Codec
por: Bie, Xiaoyu, et al.
Publicado: (2024)
por: Bie, Xiaoyu, et al.
Publicado: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
EnCodecMAE: Leveraging neural codecs for universal audio representation learning
por: Pepino, Leonardo, et al.
Publicado: (2023)
por: Pepino, Leonardo, et al.
Publicado: (2023)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
ERVQ: Enhanced Residual Vector Quantization with Intra-and-Inter-Codebook Optimization for Neural Audio Codecs
por: Zheng, Rui-Chen, et al.
Publicado: (2024)
por: Zheng, Rui-Chen, et al.
Publicado: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
por: Chen, Wenxi, et al.
Publicado: (2025)
por: Chen, Wenxi, et al.
Publicado: (2025)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
por: Wang, Xiaofei, et al.
Publicado: (2023)
por: Wang, Xiaofei, et al.
Publicado: (2023)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
MagiCodec: Simple Masked Gaussian-Injected Codec for High-Fidelity Reconstruction and Generation
por: Song, Yakun, et al.
Publicado: (2025)
por: Song, Yakun, et al.
Publicado: (2025)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
por: Yang, Leyan, et al.
Publicado: (2026)
por: Yang, Leyan, et al.
Publicado: (2026)
SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization
por: Wang, Jin, et al.
Publicado: (2025)
por: Wang, Jin, et al.
Publicado: (2025)
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
por: Vora, Jayneel, et al.
Publicado: (2024)
por: Vora, Jayneel, et al.
Publicado: (2024)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
por: Niu, Zhikang, et al.
Publicado: (2024)
por: Niu, Zhikang, et al.
Publicado: (2024)
A Context-Based Numerical Format Prediction for a Text-To-Speech System
por: Darwesh, Yaser, et al.
Publicado: (2024)
por: Darwesh, Yaser, et al.
Publicado: (2024)
Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Bringing Interpretability to Neural Audio Codecs
por: Sadok, Samir, et al.
Publicado: (2025)
por: Sadok, Samir, et al.
Publicado: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
por: Dhawan, Kunal, et al.
Publicado: (2024)
por: Dhawan, Kunal, et al.
Publicado: (2024)
Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding Distances
por: Biswas, Arijit, et al.
Publicado: (2025)
por: Biswas, Arijit, et al.
Publicado: (2025)
Benchmarking Neural Speech Codec Intelligibility with SITool
por: Leschanowsky, Anna, et al.
Publicado: (2025)
por: Leschanowsky, Anna, et al.
Publicado: (2025)
Variable Bitrate Residual Vector Quantization for Audio Coding
por: Chae, Yunkee, et al.
Publicado: (2024)
por: Chae, Yunkee, et al.
Publicado: (2024)
EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
SegINR: Segment-wise Implicit Neural Representation for Sequence Alignment in Neural Text-to-Speech
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Evaluation of Neural Surrogates for Physical Modelling Synthesis of Nonlinear Elastic Plates
por: Martin, Carlos De La Vega, et al.
Publicado: (2025)
por: Martin, Carlos De La Vega, et al.
Publicado: (2025)
Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models
por: Kwon, Taegyun, et al.
Publicado: (2024)
por: Kwon, Taegyun, et al.
Publicado: (2024)
Inference-Adaptive Neural Steering for Real-Time Area-Based Sound Source Separation
por: Strauss, Martin, et al.
Publicado: (2024)
por: Strauss, Martin, et al.
Publicado: (2024)
Towards Generalized Source Tracing for Codec-Based Deepfake Speech
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
por: Xin, Detai, et al.
Publicado: (2024)
por: Xin, Detai, et al.
Publicado: (2024)
Gull: A Generative Multifunctional Audio Codec
por: Luo, Yi, et al.
Publicado: (2024)
por: Luo, Yi, et al.
Publicado: (2024)
LiVeAction: a Lightweight, Versatile, and Asymmetric Neural Codec Design for Real-time Operation
por: Jacobellis, Dan, et al.
Publicado: (2026)
por: Jacobellis, Dan, et al.
Publicado: (2026)
Ejemplares similares
-
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
por: Wojcicki, Kamil, et al.
Publicado: (2025) -
SNAC: Multi-Scale Neural Audio Codec
por: Siuzdak, Hubert, et al.
Publicado: (2024) -
RepCodec: A Speech Representation Codec for Speech Tokenization
por: Huang, Zhichao, et al.
Publicado: (2023) -
Latent Granular Resynthesis using Neural Audio Codecs
por: Tokui, Nao, et al.
Publicado: (2025) -
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
por: Nercessian, Shahan, et al.
Publicado: (2024)