LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Tianyi, Shrivastava, Anshumali |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
Learning Scalable Structural Representations for Link Prediction with Bloom Signatures
di: Zhang, Tianyi, et al.
Pubblicazione: (2023)
di: Zhang, Tianyi, et al.
Pubblicazione: (2023)
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance
di: Kim, Jinuk, et al.
Pubblicazione: (2025)
di: Kim, Jinuk, et al.
Pubblicazione: (2025)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
di: Wang, Jinguang, et al.
Pubblicazione: (2025)
di: Wang, Jinguang, et al.
Pubblicazione: (2025)
RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization
di: Li, Zhikai, et al.
Pubblicazione: (2024)
di: Li, Zhikai, et al.
Pubblicazione: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
AffineQuant: Affine Transformation Quantization for Large Language Models
di: Ma, Yuexiao, et al.
Pubblicazione: (2024)
di: Ma, Yuexiao, et al.
Pubblicazione: (2024)
To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
di: Yang, Zeyu, et al.
Pubblicazione: (2025)
Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
CoVE: Compressed Vocabulary Expansion Makes Better LLM-based Recommender Systems
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
di: Chong, Hyochan, et al.
Pubblicazione: (2026)
di: Chong, Hyochan, et al.
Pubblicazione: (2026)
LLMEasyQuant: Scalable Quantization for Parallel and Distributed LLM Inference
di: Liu, Dong, et al.
Pubblicazione: (2024)
di: Liu, Dong, et al.
Pubblicazione: (2024)
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
di: Zhang, Tianyi, et al.
Pubblicazione: (2024)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
di: Egiazarian, Vage, et al.
Pubblicazione: (2026)
di: Egiazarian, Vage, et al.
Pubblicazione: (2026)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
di: Zhang, Nan, et al.
Pubblicazione: (2026)
di: Zhang, Nan, et al.
Pubblicazione: (2026)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2026)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2026)
Breaking the Frozen Subspace: Importance Sampling for Low-Rank Optimization in LLM Pretraining
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval
di: Yang, Zeyu, et al.
Pubblicazione: (2026)
di: Yang, Zeyu, et al.
Pubblicazione: (2026)
70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
di: Zhang, Yi, et al.
Pubblicazione: (2024)
di: Zhang, Yi, et al.
Pubblicazione: (2024)
RACE Attention: A Strictly Linear-Time Attention Layer for Training on Outrageously Large Contexts
di: Joshi, Sahil, et al.
Pubblicazione: (2025)
di: Joshi, Sahil, et al.
Pubblicazione: (2025)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
di: Hu, Xing, et al.
Pubblicazione: (2025)
di: Hu, Xing, et al.
Pubblicazione: (2025)
FrameQuant: Flexible Low-Bit Quantization for Transformers
di: Adepu, Harshavardhan, et al.
Pubblicazione: (2024)
di: Adepu, Harshavardhan, et al.
Pubblicazione: (2024)
Obstacle-aware Gaussian Process Regression
di: Shrivastava, Gaurav
Pubblicazione: (2024)
di: Shrivastava, Gaurav
Pubblicazione: (2024)
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
di: Zhang, Wenzheng, et al.
Pubblicazione: (2026)
FlatQuant: Flatness Matters for LLM Quantization
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models
di: Chen, Junyu, et al.
Pubblicazione: (2026)
di: Chen, Junyu, et al.
Pubblicazione: (2026)
Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance
di: Shen, Ao, et al.
Pubblicazione: (2024)
di: Shen, Ao, et al.
Pubblicazione: (2024)
PolarQuant: Quantizing KV Caches with Polar Transformation
di: Han, Insu, et al.
Pubblicazione: (2025)
di: Han, Insu, et al.
Pubblicazione: (2025)
Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference
di: Le, Hoang Anh Duy, et al.
Pubblicazione: (2026)
di: Le, Hoang Anh Duy, et al.
Pubblicazione: (2026)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
di: Liu, Jing, et al.
Pubblicazione: (2023)
di: Liu, Jing, et al.
Pubblicazione: (2023)
QuantKAN: A Unified Quantization Framework for Kolmogorov Arnold Networks
di: Fuad, Kazi Ahmed Asif, et al.
Pubblicazione: (2025)
di: Fuad, Kazi Ahmed Asif, et al.
Pubblicazione: (2025)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
di: Zhang, Tianyi, et al.
Pubblicazione: (2024) -
Learning Scalable Structural Representations for Link Prediction with Bloom Signatures
di: Zhang, Tianyi, et al.
Pubblicazione: (2023) -
GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance
di: Kim, Jinuk, et al.
Pubblicazione: (2025) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022) -
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
di: Wang, Jinguang, et al.
Pubblicazione: (2025)