Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations
Fuente:
arXiv
Saved in:
| Main Authors: | Han, Yichen, Hao, Xiaoyang, Chen, Keming, Xiong, Weibo, He, Jun, Zhang, Ruonan, Cao, Junjie, Liu, Yue, Li, Bowen, Zhang, Dongrui, Xia, Hui, Fu, Huilei, Jia, Kai, Guo, Kaixuan, Jin, Mingli, Meng, Qingyun, Ma, Ruidong, Fang, Ruiqian, Guo, Shaotong, Li, Xuhui, Xiang, Yang, Zhang, Ying, Liu, Yulong, Li, Yunfeng, Zhang, Yuyi, Zhou, Yuze, Wang, Zhen, Chen, Zhaowen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
by: Chen, Kejia, et al.
Published: (2025)
by: Chen, Kejia, et al.
Published: (2025)
QuantDemoire: Quantization with Outlier Aware for Image Demoiréing
by: Chen, Zheng, et al.
Published: (2025)
by: Chen, Zheng, et al.
Published: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
by: Xiao, Haiyang, et al.
Published: (2026)
by: Xiao, Haiyang, et al.
Published: (2026)
Quantize What Counts: More for Keys, Less for Values
by: Hariri, Mohsen, et al.
Published: (2025)
by: Hariri, Mohsen, et al.
Published: (2025)
decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points
by: Guo, Yi, et al.
Published: (2024)
by: Guo, Yi, et al.
Published: (2024)
Local Differential Privacy via Dynamic Quantization in Distributed Online Stochastic Optimization
by: Zhang, Zhiguo, et al.
Published: (2026)
by: Zhang, Zhiguo, et al.
Published: (2026)
Soft then Hard: Rethinking the Quantization in Neural Image Compression
by: Guo, Zongyu, et al.
Published: (2021)
by: Guo, Zongyu, et al.
Published: (2021)
Graph is a Natural Regularization: Revisiting Vector Quantization for Graph Representation Learning
by: Zhai, Zian, et al.
Published: (2025)
by: Zhai, Zian, et al.
Published: (2025)
Efficient Edge LLMs Deployment via HessianAware Quantization and CPU GPU Collaborative
by: Zhang, Tuo, et al.
Published: (2025)
by: Zhang, Tuo, et al.
Published: (2025)
Aquila: A Hierarchically Aligned Visual-Language Model for Enhanced Remote Sensing Image Comprehension
by: Lu, Kaixuan, et al.
Published: (2024)
by: Lu, Kaixuan, et al.
Published: (2024)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
by: Zhang, Junkai, et al.
Published: (2026)
by: Zhang, Junkai, et al.
Published: (2026)
Quantized Spike-driven Transformer
by: Qiu, Xuerui, et al.
Published: (2025)
by: Qiu, Xuerui, et al.
Published: (2025)
Enhancing Photocatalytic Hydrogen Evolution by Improving the Morphology of Organic Semiconductor Nanoparticles with TCB Additive
by: Tong Liu, et al.
Published: (2025)
by: Tong Liu, et al.
Published: (2025)
Quantized Topological Anderson-Thouless Pump
by: Wu, Yi-Piao, et al.
Published: (2022)
by: Wu, Yi-Piao, et al.
Published: (2022)
QuantVSR: Low-Bit Post-Training Quantization for Real-World Video Super-Resolution
by: Chai, Bowen, et al.
Published: (2025)
by: Chai, Bowen, et al.
Published: (2025)
QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition
by: Hu, Yuxuan, et al.
Published: (2025)
by: Hu, Yuxuan, et al.
Published: (2025)
CondiQuant: Condition Number Based Low-Bit Quantization for Image Super-Resolution
by: Liu, Kai, et al.
Published: (2025)
by: Liu, Kai, et al.
Published: (2025)
Quantized Andreev conductance in semiconductor nanowires
by: Gao, Yichun, et al.
Published: (2024)
by: Gao, Yichun, et al.
Published: (2024)
MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization
by: Jia, Mingkai, et al.
Published: (2025)
by: Jia, Mingkai, et al.
Published: (2025)
Gaussian Rate-Distortion-Perception Coding and Entropy-Constrained Scalar Quantization
by: Xie, Li, et al.
Published: (2024)
by: Xie, Li, et al.
Published: (2024)
Forget by Uncertainty: Orthogonal Entropy Unlearning for Quantized Neural Networks
by: Zhang, Tian, et al.
Published: (2026)
by: Zhang, Tian, et al.
Published: (2026)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
by: Zhao, Weibo, et al.
Published: (2024)
by: Zhao, Weibo, et al.
Published: (2024)
Adaptive Dataset Quantization
by: Li, Muquan, et al.
Published: (2024)
by: Li, Muquan, et al.
Published: (2024)
ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models
by: Guo, Wenbin, et al.
Published: (2025)
by: Guo, Wenbin, et al.
Published: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
by: Zhang, Tianao, et al.
Published: (2025)
by: Zhang, Tianao, et al.
Published: (2025)
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
by: Chen, Yujie, et al.
Published: (2025)
by: Chen, Yujie, et al.
Published: (2025)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
by: Qin, Guangshuo, et al.
Published: (2026)
by: Qin, Guangshuo, et al.
Published: (2026)
Diffusion Model Quantization: A Review
by: Zeng, Qian, et al.
Published: (2025)
by: Zeng, Qian, et al.
Published: (2025)
MoQE: Improve Quantization Model performance via Mixture of Quantization Experts
by: Zhang, Jinhao, et al.
Published: (2025)
by: Zhang, Jinhao, et al.
Published: (2025)
Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
by: Lin, Haokun, et al.
Published: (2025)
by: Lin, Haokun, et al.
Published: (2025)
Quantized Input and Output‐Based Identification of FIR Systems With Event‐Triggered Communication and Data Packet Drop
by: Lingfeng Chen, et al.
Published: (2025)
by: Lingfeng Chen, et al.
Published: (2025)
Does ESG Report Tone Influence ESG Rating Divergence? Evidence From China
by: Yanmei Luo, et al.
Published: (2025)
by: Yanmei Luo, et al.
Published: (2025)
Three‐dimensional Numerical Simulation of Local Scour of Bridge Piers under Constant Current using Asynchronous Time Marching Scheme
by: Ruiqian Zhang, et al.
Published: (2025)
by: Ruiqian Zhang, et al.
Published: (2025)
MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts
by: Tao, Wei, et al.
Published: (2025)
by: Tao, Wei, et al.
Published: (2025)
Channel-wise Vector Quantization
by: Song, Wei, et al.
Published: (2026)
by: Song, Wei, et al.
Published: (2026)
Quantization Aware Attack: Enhancing Transferable Adversarial Attacks by Model Quantization
by: Yang, Yulong, et al.
Published: (2023)
by: Yang, Yulong, et al.
Published: (2023)
QM-ToT: A Medical Tree of Thoughts Reasoning Framework for Quantized Model
by: Yang, Zongxian, et al.
Published: (2025)
by: Yang, Zongxian, et al.
Published: (2025)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
by: Zou, Minghui, et al.
Published: (2024)
by: Zou, Minghui, et al.
Published: (2024)
Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs
by: Guo, Hang, et al.
Published: (2025)
by: Guo, Hang, et al.
Published: (2025)
M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
by: Hu, Weiming, et al.
Published: (2026)
by: Hu, Weiming, et al.
Published: (2026)
Similar Items
-
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
by: Chen, Kejia, et al.
Published: (2025) -
QuantDemoire: Quantization with Outlier Aware for Image Demoiréing
by: Chen, Zheng, et al.
Published: (2025) -
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
by: Xiao, Haiyang, et al.
Published: (2026) -
Quantize What Counts: More for Keys, Less for Values
by: Hariri, Mohsen, et al.
Published: (2025) -
decoupleQ: Towards 2-bit Post-Training Uniform Quantization via decoupling Parameters into Integer and Floating Points
by: Guo, Yi, et al.
Published: (2024)