Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhou, Chenxi, Cao, Pengfei, Li, Jiang, Yu, Bohan, Ye, Jinyu, Zhao, Jun, Liu, Kang
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866908985096929280
author Zhou, Chenxi
Cao, Pengfei
Li, Jiang
Yu, Bohan
Ye, Jinyu
Zhao, Jun
Liu, Kang
author_facet Zhou, Chenxi
Cao, Pengfei
Li, Jiang
Yu, Bohan
Ye, Jinyu
Zhao, Jun
Liu, Kang
contents Post-Training Quantization (PTQ) is a critical strategy for efficient Large Language Models (LLMs) deployment. However, existing scaling laws primarily focus on general performance, overlooking crucial fine-grained factors and how quantization differentially impacts diverse knowledge capabilities. To address this, we establish Task-Stratified Knowledge Scaling Laws. By stratifying capabilities into memorization, application, and reasoning, we develop a framework that unifies model size, bit-width, and fine-grained factors: group size and calibration set size. Validated on 293 diverse PTQ configurations, our framework demonstrates strong fit and cross-architecture consistency. It reveals distinct sensitivities across knowledge capabilities: reasoning is precision-critical, application is scale-responsive, and memorization is calibration-sensitive. We highlight that in low-bit scenarios, optimizing these fine-grained factors is essential for preventing performance collapse. These findings provide an empirically-backed foundation for designing knowledge-aware quantization strategies.
format Preprint
id arxiv_https___arxiv_org_abs_2508_18609
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
Zhou, Chenxi
Cao, Pengfei
Li, Jiang
Yu, Bohan
Ye, Jinyu
Zhao, Jun
Liu, Kang
Computation and Language
Artificial Intelligence
Machine Learning
Post-Training Quantization (PTQ) is a critical strategy for efficient Large Language Models (LLMs) deployment. However, existing scaling laws primarily focus on general performance, overlooking crucial fine-grained factors and how quantization differentially impacts diverse knowledge capabilities. To address this, we establish Task-Stratified Knowledge Scaling Laws. By stratifying capabilities into memorization, application, and reasoning, we develop a framework that unifies model size, bit-width, and fine-grained factors: group size and calibration set size. Validated on 293 diverse PTQ configurations, our framework demonstrates strong fit and cross-architecture consistency. It reveals distinct sensitivities across knowledge capabilities: reasoning is precision-critical, application is scale-responsive, and memorization is calibration-sensitive. We highlight that in low-bit scenarios, optimizing these fine-grained factors is essential for preventing performance collapse. These findings provide an empirically-backed foundation for designing knowledge-aware quantization strategies.
title Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
topic Computation and Language
Artificial Intelligence
Machine Learning
url https://arxiv.org/abs/2508.18609