OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zhikai, Dong, Zhen, Liu, Xuewen, Zhang, Jing, Gu, Qingyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization
di: Li, Zhikai, et al.
Pubblicazione: (2024)
di: Li, Zhikai, et al.
Pubblicazione: (2024)
EDA-DM: Enhanced Distribution Alignment for Post-Training Quantization of Diffusion Models
di: Liu, Xuewen, et al.
Pubblicazione: (2024)
di: Liu, Xuewen, et al.
Pubblicazione: (2024)
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
di: Li, Zhikai, et al.
Pubblicazione: (2023)
di: Li, Zhikai, et al.
Pubblicazione: (2023)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
TTAQ: Towards Stable Post-training Quantization in Continuous Domain Adaptation
di: Xiao, Junrui, et al.
Pubblicazione: (2024)
di: Xiao, Junrui, et al.
Pubblicazione: (2024)
Rethinking Channel Dimensions to Isolate Outliers for Low-bit Weight Quantization of Large Language Models
di: Heo, Jung Hwan, et al.
Pubblicazione: (2023)
di: Heo, Jung Hwan, et al.
Pubblicazione: (2023)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
di: Yan, Xianglong, et al.
Pubblicazione: (2026)
SAQ-SAM: Semantically-Aligned Quantization for Segment Anything Model
di: Zhang, Jing, et al.
Pubblicazione: (2025)
di: Zhang, Jing, et al.
Pubblicazione: (2025)
DilateQuant: Accurate and Efficient Diffusion Quantization via Weight Dilation
di: Liu, Xuewen, et al.
Pubblicazione: (2024)
di: Liu, Xuewen, et al.
Pubblicazione: (2024)
ICQuant: Index Coding enables Low-bit LLM Quantization
di: Li, Xinlin, et al.
Pubblicazione: (2025)
di: Li, Xinlin, et al.
Pubblicazione: (2025)
PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models
di: Liu, Xuewen, et al.
Pubblicazione: (2026)
di: Liu, Xuewen, et al.
Pubblicazione: (2026)
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
di: Zhou, Zhaojing, et al.
Pubblicazione: (2025)
di: Zhou, Zhaojing, et al.
Pubblicazione: (2025)
Efficient-SAM2: Accelerating SAM2 with Object-Aware Visual Encoding and Memory Retrieval
di: Zhang, Jing, et al.
Pubblicazione: (2026)
di: Zhang, Jing, et al.
Pubblicazione: (2026)
CacheQuant: Comprehensively Accelerated Diffusion Models
di: Liu, Xuewen, et al.
Pubblicazione: (2025)
di: Liu, Xuewen, et al.
Pubblicazione: (2025)
ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
Sparsity Induction for Accurate Post-Training Pruning of Large Language Models
di: Jiang, Minhao, et al.
Pubblicazione: (2026)
di: Jiang, Minhao, et al.
Pubblicazione: (2026)
Privacy-Preserving SAM Quantization for Efficient Edge Intelligence in Healthcare
di: Li, Zhikai, et al.
Pubblicazione: (2024)
di: Li, Zhikai, et al.
Pubblicazione: (2024)
Low-bit Model Quantization for Deep Neural Networks: A Survey
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
di: Xia, Haojun, et al.
Pubblicazione: (2025)
di: Xia, Haojun, et al.
Pubblicazione: (2025)
INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
di: Chen, Mengzhao, et al.
Pubblicazione: (2025)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
di: Liu, Jing, et al.
Pubblicazione: (2023)
di: Liu, Jing, et al.
Pubblicazione: (2023)
SKIM: Any-bit Quantization Pushing The Limits of Post-Training Quantization
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
di: Bai, Runsheng, et al.
Pubblicazione: (2024)
CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
di: Yin, Xiangyang, et al.
Pubblicazione: (2026)
di: Yin, Xiangyang, et al.
Pubblicazione: (2026)
Towards Low-bit Communication for Tensor Parallel LLM Inference
di: Dong, Harry, et al.
Pubblicazione: (2024)
di: Dong, Harry, et al.
Pubblicazione: (2024)
MergeQuant: Accurate 4-bit Static Quantization of Large Language Models by Channel-wise Calibration
di: Wang, Jinguang, et al.
Pubblicazione: (2025)
di: Wang, Jinguang, et al.
Pubblicazione: (2025)
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
di: Zhan, Xiaohua, et al.
Pubblicazione: (2026)
di: Zhan, Xiaohua, et al.
Pubblicazione: (2026)
LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization
di: Bouquet, Yann, et al.
Pubblicazione: (2026)
di: Bouquet, Yann, et al.
Pubblicazione: (2026)
Qrazor: Reliable and Effortless 4-bit LLM Quantization by Significant Data Razoring
di: Lee, Dongyoung, et al.
Pubblicazione: (2025)
di: Lee, Dongyoung, et al.
Pubblicazione: (2025)
Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation
di: Liu, Xuewen, et al.
Pubblicazione: (2025)
di: Liu, Xuewen, et al.
Pubblicazione: (2025)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
Irrational Complex Rotations Empower Low-bit Optimizers
di: Tian, Zhen, et al.
Pubblicazione: (2025)
di: Tian, Zhen, et al.
Pubblicazione: (2025)
AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation
di: Kim, Seonggon, et al.
Pubblicazione: (2026)
di: Kim, Seonggon, et al.
Pubblicazione: (2026)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
di: IslamBouli, Beshr, et al.
Pubblicazione: (2026)
di: IslamBouli, Beshr, et al.
Pubblicazione: (2026)
Beyond Outliers: A Study of Optimizers Under Quantization
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
di: Vlassis, Georgios, et al.
Pubblicazione: (2025)
Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
di: Li, Zhikai, et al.
Pubblicazione: (2026)
di: Li, Zhikai, et al.
Pubblicazione: (2026)
Three Revisits to Node-Level Graph Anomaly Detection: Outliers, Message Passing and Hyperbolic Neural Networks
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
Rethinking RoPE Scaling in Quantized LLM: Theory, Outlier, and Channel-Band Analysis with Weight Rescaling
di: Qiao, Ye, et al.
Pubblicazione: (2025)
di: Qiao, Ye, et al.
Pubblicazione: (2025)
LO-BCQ: Block Clustered Quantization for 4-bit (W4A4) LLM Inference
di: Elangovan, Reena, et al.
Pubblicazione: (2025)
di: Elangovan, Reena, et al.
Pubblicazione: (2025)
SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size
di: Xia, Junhao, et al.
Pubblicazione: (2025)
di: Xia, Junhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RepQuant: Towards Accurate Post-Training Quantization of Large Transformer Models via Scale Reparameterization
di: Li, Zhikai, et al.
Pubblicazione: (2024) -
EDA-DM: Enhanced Distribution Alignment for Post-Training Quantization of Diffusion Models
di: Liu, Xuewen, et al.
Pubblicazione: (2024) -
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
di: Li, Zhikai, et al.
Pubblicazione: (2023) -
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
di: Zhao, Yilong, et al.
Pubblicazione: (2023) -
TTAQ: Towards Stable Post-training Quantization in Continuous Domain Adaptation
di: Xiao, Junrui, et al.
Pubblicazione: (2024)