AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | IslamBouli, Beshr, Jin, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling
di: Sharma, Preetam, et al.
Pubblicazione: (2026)
di: Sharma, Preetam, et al.
Pubblicazione: (2026)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
di: Song, Yurun, et al.
Pubblicazione: (2025)
di: Song, Yurun, et al.
Pubblicazione: (2025)
Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization
di: Kennedy, Ian W., et al.
Pubblicazione: (2026)
di: Kennedy, Ian W., et al.
Pubblicazione: (2026)
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
di: Blumenberg, Patrick, et al.
Pubblicazione: (2025)
di: Blumenberg, Patrick, et al.
Pubblicazione: (2025)
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks
di: Tseng, Albert, et al.
Pubblicazione: (2024)
di: Tseng, Albert, et al.
Pubblicazione: (2024)
LCQ: Low-Rank Codebook based Quantization for Large Language Models
di: Cai, Wen-Pu, et al.
Pubblicazione: (2024)
di: Cai, Wen-Pu, et al.
Pubblicazione: (2024)
TTQ: Activation-Aware Test-Time Quantization to Accelerate LLM Inference On The Fly
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2026)
di: Koike-Akino, Toshiaki, et al.
Pubblicazione: (2026)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
di: Liu, Zirui, et al.
Pubblicazione: (2024)
di: Liu, Zirui, et al.
Pubblicazione: (2024)
Turning LLM Activations Quantization-Friendly
di: Czakó, Patrik, et al.
Pubblicazione: (2025)
di: Czakó, Patrik, et al.
Pubblicazione: (2025)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
di: Vicentino, Caio
Pubblicazione: (2026)
di: Vicentino, Caio
Pubblicazione: (2026)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
di: Shao, Yihua, et al.
Pubblicazione: (2024)
di: Shao, Yihua, et al.
Pubblicazione: (2024)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
Scaling Law for Quantization-Aware Training
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization
di: Wang, YiFeng, et al.
Pubblicazione: (2026)
di: Wang, YiFeng, et al.
Pubblicazione: (2026)
Enhancing Post-Training Quantization via Future Activation Awareness
di: Lv, Zheqi, et al.
Pubblicazione: (2026)
di: Lv, Zheqi, et al.
Pubblicazione: (2026)
QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
di: Hu, Yuxuan, et al.
Pubblicazione: (2025)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
di: Wang, Dongwei, et al.
Pubblicazione: (2024)
di: Wang, Dongwei, et al.
Pubblicazione: (2024)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
di: Lee, Jaehyeok, et al.
Pubblicazione: (2026)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
SqueezeLLM: Dense-and-Sparse Quantization
di: Kim, Sehoon, et al.
Pubblicazione: (2023)
di: Kim, Sehoon, et al.
Pubblicazione: (2023)
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
di: Cook, Jack, et al.
Pubblicazione: (2025)
di: Cook, Jack, et al.
Pubblicazione: (2025)
Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning
di: Kim, Junseok, et al.
Pubblicazione: (2026)
di: Kim, Junseok, et al.
Pubblicazione: (2026)
Highly Optimized Kernels and Fine-Grained Codebooks for LLM Inference on Arm CPUs
di: Gope, Dibakar, et al.
Pubblicazione: (2024)
di: Gope, Dibakar, et al.
Pubblicazione: (2024)
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
di: Young, Sean I.
Pubblicazione: (2024)
di: Young, Sean I.
Pubblicazione: (2024)
Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs
di: Yang, Jaewoo, et al.
Pubblicazione: (2024)
di: Yang, Jaewoo, et al.
Pubblicazione: (2024)
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
di: Nrusimha, Aniruddha, et al.
Pubblicazione: (2024)
di: Nrusimha, Aniruddha, et al.
Pubblicazione: (2024)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
di: Jeon, Hyesung, et al.
Pubblicazione: (2024)
di: Jeon, Hyesung, et al.
Pubblicazione: (2024)
LLM Router: Rethinking Routing with Prefill Activations
di: Varshney, Tanay, et al.
Pubblicazione: (2026)
di: Varshney, Tanay, et al.
Pubblicazione: (2026)
iFairy: the First 2-bit Complex LLM with All Parameters in $\{\pm1, \pm i\}$
di: Wang, Feiyu, et al.
Pubblicazione: (2025)
di: Wang, Feiyu, et al.
Pubblicazione: (2025)
FlatQuant: Flatness Matters for LLM Quantization
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
di: Hegazy, Amr, et al.
Pubblicazione: (2025)
di: Hegazy, Amr, et al.
Pubblicazione: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
di: Wang, Dongwei, et al.
Pubblicazione: (2026)
di: Wang, Dongwei, et al.
Pubblicazione: (2026)
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
di: Lee, Sangjun, et al.
Pubblicazione: (2025)
di: Lee, Sangjun, et al.
Pubblicazione: (2025)
A Word is Worth 4-bit: Efficient Log Parsing with Binary Coded Decimal Recognition
di: Srivastava, Prerak, et al.
Pubblicazione: (2025)
di: Srivastava, Prerak, et al.
Pubblicazione: (2025)
Documenti analoghi
-
QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling
di: Sharma, Preetam, et al.
Pubblicazione: (2026) -
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
di: Song, Yurun, et al.
Pubblicazione: (2025) -
Initialisation Determines the Basin: Efficient Codebook Optimisation for Extreme LLM Quantization
di: Kennedy, Ian W., et al.
Pubblicazione: (2026) -
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024) -
Improving Block-Wise LLM Quantization by 4-bit Block-Wise Optimal Float (BOF4): Analysis and Variations
di: Blumenberg, Patrick, et al.
Pubblicazione: (2025)