SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Czakó, Patrik, Kertész, Gábor, Szénási, Sándor |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Turning LLM Activations Quantization-Friendly
par: Czakó, Patrik, et autres
Publié: (2025)
par: Czakó, Patrik, et autres
Publié: (2025)
Achieving Peak Performance for Large Language Models: A Systematic Review
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2024)
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2024)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
par: Gadhikar, Advait, et autres
Publié: (2025)
par: Gadhikar, Advait, et autres
Publié: (2025)
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
par: Ichikawa, Yuma, et autres
Publié: (2025)
par: Ichikawa, Yuma, et autres
Publié: (2025)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
par: He, Liulu, et autres
Publié: (2025)
par: He, Liulu, et autres
Publié: (2025)
Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
par: Huang, Xijie, et autres
Publié: (2024)
par: Huang, Xijie, et autres
Publié: (2024)
Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer
par: Choi, Euntae, et autres
Publié: (2025)
par: Choi, Euntae, et autres
Publié: (2025)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
par: Guo, Song, et autres
Publié: (2024)
par: Guo, Song, et autres
Publié: (2024)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
par: He, Junhui, et autres
Publié: (2024)
par: He, Junhui, et autres
Publié: (2024)
Interpreting the Effects of Quantization on LLMs
par: Singh, Manpreet, et autres
Publié: (2025)
par: Singh, Manpreet, et autres
Publié: (2025)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
par: Xu, Zukang, et autres
Publié: (2025)
par: Xu, Zukang, et autres
Publié: (2025)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022)
par: Xiao, Guangxuan, et autres
Publié: (2022)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
par: Wang, Yanshu, et autres
Publié: (2024)
par: Wang, Yanshu, et autres
Publié: (2024)
Low-Rank Quantization-Aware Training for LLMs
par: Bondarenko, Yelysei, et autres
Publié: (2024)
par: Bondarenko, Yelysei, et autres
Publié: (2024)
Continuous Approximations for Improving Quantization Aware Training of LLMs
par: Li, He, et autres
Publié: (2024)
par: Li, He, et autres
Publié: (2024)
Layer-Wise Quantization: A Pragmatic and Effective Method for Quantizing LLMs Beyond Integer Bit-Levels
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Evaluating the Generalization Ability of Quantized LLMs: Benchmark, Analysis, and Toolbox
par: Liu, Yijun, et autres
Publié: (2024)
par: Liu, Yijun, et autres
Publié: (2024)
RSQ: Learning from Important Tokens Leads to Better Quantized LLMs
par: Sung, Yi-Lin, et autres
Publié: (2025)
par: Sung, Yi-Lin, et autres
Publié: (2025)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
par: Cheng, Wenhua, et autres
Publié: (2023)
par: Cheng, Wenhua, et autres
Publié: (2023)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
par: Xiong, Boya, et autres
Publié: (2025)
par: Xiong, Boya, et autres
Publié: (2025)
Advancing Scientific Text Classification: Fine-Tuned Models with Dataset Expansion and Hard-Voting
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2025)
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2025)
EQ-5D Classification Using Biomedical Entity-Enriched Pre-trained Language Models and Multiple Instance Learning
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2026)
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
par: Zhou, Chenxi, et autres
Publié: (2025)
par: Zhou, Chenxi, et autres
Publié: (2025)
Scaling Laws for Predicting Downstream Performance in LLMs
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
Quantifying the Capabilities of LLMs across Scale and Precision
par: Badshah, Sher, et autres
Publié: (2024)
par: Badshah, Sher, et autres
Publié: (2024)
GSQ-Tuning: Group-Shared Exponents Integer in Fully Quantized Training for LLMs On-Device Fine-tuning
par: Zhou, Sifan, et autres
Publié: (2025)
par: Zhou, Sifan, et autres
Publié: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
par: Taniguchi, Rei, et autres
Publié: (2026)
par: Taniguchi, Rei, et autres
Publié: (2026)
Channel-Wise Mixed-Precision Quantization for Large Language Models
par: Chen, Zihan, et autres
Publié: (2024)
par: Chen, Zihan, et autres
Publié: (2024)
Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs
par: Park, Jungsoo, et autres
Publié: (2025)
par: Park, Jungsoo, et autres
Publié: (2025)
ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
par: Lin, Bill Yuchen, et autres
Publié: (2025)
par: Lin, Bill Yuchen, et autres
Publié: (2025)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
par: Sim, Woo Seob, et autres
Publié: (2026)
par: Sim, Woo Seob, et autres
Publié: (2026)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Documents similaires
-
Turning LLM Activations Quantization-Friendly
par: Czakó, Patrik, et autres
Publié: (2025) -
Achieving Peak Performance for Large Language Models: A Systematic Review
par: Rostam, Zhyar Rzgar K, et autres
Publié: (2024) -
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
par: Gadhikar, Advait, et autres
Publié: (2025) -
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
par: Ichikawa, Yuma, et autres
Publié: (2025) -
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)