Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xi, Wu, Xiaolin, Wang, Jiamang, Lin, Weisi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Why Do Some Inputs Break Low-Bit LLM Quantization?
por: Chang, Ting-Yun, et al.
Publicado: (2025)
por: Chang, Ting-Yun, et al.
Publicado: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
por: Li, Ke, et al.
Publicado: (2026)
por: Li, Ke, et al.
Publicado: (2026)
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
por: Zou, Sunan, et al.
Publicado: (2025)
por: Zou, Sunan, et al.
Publicado: (2025)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
por: Song, Jaewoo, et al.
Publicado: (2025)
por: Song, Jaewoo, et al.
Publicado: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
por: Son, Donghyun, et al.
Publicado: (2025)
por: Son, Donghyun, et al.
Publicado: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
por: Zhang, Tianao, et al.
Publicado: (2025)
por: Zhang, Tianao, et al.
Publicado: (2025)
VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation
por: Zhai, Linwei, et al.
Publicado: (2026)
por: Zhai, Linwei, et al.
Publicado: (2026)
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
por: Song, Jaewoo, et al.
Publicado: (2025)
por: Song, Jaewoo, et al.
Publicado: (2025)
Tiled Bit Networks: Sub-Bit Neural Network Compression Through Reuse of Learnable Binary Vectors
por: Gorbett, Matt, et al.
Publicado: (2024)
por: Gorbett, Matt, et al.
Publicado: (2024)
Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
por: Lee, Deokjae, et al.
Publicado: (2025)
por: Lee, Deokjae, et al.
Publicado: (2025)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
por: Lee, Banseok, et al.
Publicado: (2025)
por: Lee, Banseok, et al.
Publicado: (2025)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
por: Zhao, Jiayu, et al.
Publicado: (2026)
por: Zhao, Jiayu, et al.
Publicado: (2026)
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
por: Zhang, Peiyuan, et al.
Publicado: (2026)
por: Zhang, Peiyuan, et al.
Publicado: (2026)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
por: Zhao, Zhixiong, et al.
Publicado: (2025)
por: Zhao, Zhixiong, et al.
Publicado: (2025)
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
HeRo-Q: A General Framework for Stable Low Bit Quantization via Hessian Conditioning
por: Zhang, Jinhao Zhang Yunquan, et al.
Publicado: (2026)
por: Zhang, Jinhao Zhang Yunquan, et al.
Publicado: (2026)
ECQ$^{\text{x}}$: Explainability-Driven Quantization for Low-Bit and Sparse DNNs
por: Becking, Daniel, et al.
Publicado: (2021)
por: Becking, Daniel, et al.
Publicado: (2021)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs
por: Wang, Guoan, et al.
Publicado: (2026)
por: Wang, Guoan, et al.
Publicado: (2026)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
por: Zhao, Jiaqi, et al.
Publicado: (2025)
por: Zhao, Jiaqi, et al.
Publicado: (2025)
RQ-MoE: Residual Quantization via Mixture of Experts for Efficient Input-Dependent Vector Compression
por: Zhong, Zhengjia, et al.
Publicado: (2026)
por: Zhong, Zhengjia, et al.
Publicado: (2026)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
por: Hu, Xing, et al.
Publicado: (2024)
por: Hu, Xing, et al.
Publicado: (2024)
Graph is a Natural Regularization: Revisiting Vector Quantization for Graph Representation Learning
por: Zhai, Zian, et al.
Publicado: (2025)
por: Zhai, Zian, et al.
Publicado: (2025)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
por: Mozaffari, Mohammad, et al.
Publicado: (2024)
por: Mozaffari, Mohammad, et al.
Publicado: (2024)
Lattice: Learning to Efficiently Compress the Memory
por: Karami, Mahdi, et al.
Publicado: (2025)
por: Karami, Mahdi, et al.
Publicado: (2025)
FoldToken: Learning Protein Language via Vector Quantization and Beyond
por: Gao, Zhangyang, et al.
Publicado: (2024)
por: Gao, Zhangyang, et al.
Publicado: (2024)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026)
por: Wang, Dongwei, et al.
Publicado: (2026)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
por: Yu, Xiaoming, et al.
Publicado: (2026)
por: Yu, Xiaoming, et al.
Publicado: (2026)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
por: Zhang, Junkai, et al.
Publicado: (2026)
por: Zhang, Junkai, et al.
Publicado: (2026)
Gradient Based Method for the Fusion of Lattice Quantizers
por: Zhang, Liyuan, et al.
Publicado: (2025)
por: Zhang, Liyuan, et al.
Publicado: (2025)
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
por: Gernigon, Cédric, et al.
Publicado: (2024)
por: Gernigon, Cédric, et al.
Publicado: (2024)
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
por: Huang, Hong, et al.
Publicado: (2026)
por: Huang, Hong, et al.
Publicado: (2026)
SQS: Bayesian DNN Compression through Sparse Quantized Sub-distributions
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
Vector Quantization in the Brain: Grid-like Codes in World Models
por: Peng, Xiangyuan, et al.
Publicado: (2025)
por: Peng, Xiangyuan, et al.
Publicado: (2025)
Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics
por: Xu, Cong, et al.
Publicado: (2025)
por: Xu, Cong, et al.
Publicado: (2025)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
por: Tao, Qian, et al.
Publicado: (2024)
por: Tao, Qian, et al.
Publicado: (2024)
FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression
por: Lee, Namyoon, et al.
Publicado: (2026)
por: Lee, Namyoon, et al.
Publicado: (2026)
HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs
por: Chen, Ningning, et al.
Publicado: (2025)
por: Chen, Ningning, et al.
Publicado: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
por: Lv, Keyu, et al.
Publicado: (2026)
por: Lv, Keyu, et al.
Publicado: (2026)
Representation Collapsing Problems in Vector Quantization
por: Zhao, Wenhao, et al.
Publicado: (2024)
por: Zhao, Wenhao, et al.
Publicado: (2024)
Ejemplares similares
-
Why Do Some Inputs Break Low-Bit LLM Quantization?
por: Chang, Ting-Yun, et al.
Publicado: (2025) -
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
por: Li, Ke, et al.
Publicado: (2026) -
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
por: Zou, Sunan, et al.
Publicado: (2025) -
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
por: Song, Jaewoo, et al.
Publicado: (2025) -
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
por: Son, Donghyun, et al.
Publicado: (2025)