ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Weibo, Shi, Yubin, Lyu, Xinyu, Sui, Wanchen, Li, Shen, Li, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Saliency-Aware Regularized Quantization Calibration for Large Language Models
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
di: Zhao, Yanlong, et al.
Pubblicazione: (2026)
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
di: Cho, Yoonjun, et al.
Pubblicazione: (2026)
di: Cho, Yoonjun, et al.
Pubblicazione: (2026)
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
di: Zhang, Zhengxin, et al.
Pubblicazione: (2024)
di: Zhang, Zhengxin, et al.
Pubblicazione: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
di: Zou, Minghui, et al.
Pubblicazione: (2024)
di: Zou, Minghui, et al.
Pubblicazione: (2024)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
di: Zhang, Tianao, et al.
Pubblicazione: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
di: Huang, Hong, et al.
Pubblicazione: (2025)
di: Huang, Hong, et al.
Pubblicazione: (2025)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
di: Xiao, He, et al.
Pubblicazione: (2025)
di: Xiao, He, et al.
Pubblicazione: (2025)
FAQ: Mitigating Quantization Error via Regenerating Calibration Data with Family-Aware Quantization
di: Xiao, Haiyang, et al.
Pubblicazione: (2026)
di: Xiao, Haiyang, et al.
Pubblicazione: (2026)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
RILQ: Rank-Insensitive LoRA-based Quantization Error Compensation for Boosting 2-bit Large Language Model Accuracy
di: Lee, Geonho, et al.
Pubblicazione: (2024)
di: Lee, Geonho, et al.
Pubblicazione: (2024)
Activation Sparsity Opportunities for Compressing General Large Language Models
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
Large Language Model Agent for Hyper-Parameter Optimization
di: Liu, Siyi, et al.
Pubblicazione: (2024)
di: Liu, Siyi, et al.
Pubblicazione: (2024)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
di: Zhou, Jiajun, et al.
Pubblicazione: (2025)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
di: Zheng, Xingyu, et al.
Pubblicazione: (2025)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
di: Liu, Wenyuan, et al.
Pubblicazione: (2025)
di: Liu, Wenyuan, et al.
Pubblicazione: (2025)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
di: Li, Junlin, et al.
Pubblicazione: (2026)
di: Li, Junlin, et al.
Pubblicazione: (2026)
Post Training Quantization of Large Language Models with Microscaling Formats
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
di: Sharify, Sayeh, et al.
Pubblicazione: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
di: Robey, Alexander, et al.
Pubblicazione: (2023)
di: Robey, Alexander, et al.
Pubblicazione: (2023)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
di: Zhao, Pengxiang, et al.
Pubblicazione: (2025)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
di: Zhou, Chenxi, et al.
Pubblicazione: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Understanding Post-Training Structural Changes in Large Language Models
di: He, Xinyu, et al.
Pubblicazione: (2025)
di: He, Xinyu, et al.
Pubblicazione: (2025)
DeltaDQ: Ultra-High Delta Compression for Fine-Tuned LLMs via Group-wise Dropout and Separate Quantization
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
di: Jiang, Yanfeng, et al.
Pubblicazione: (2024)
AMS-QUANT: Adaptive Mantissa Sharing for Floating-point Quantization
di: Lv, Mengtao, et al.
Pubblicazione: (2025)
di: Lv, Mengtao, et al.
Pubblicazione: (2025)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
di: Wei, Quan, et al.
Pubblicazione: (2025)
di: Wei, Quan, et al.
Pubblicazione: (2025)
Art and Science of Quantizing Large-Scale Models: A Comprehensive Overview
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
Steering Large Language Model Activations in Sparse Spaces
di: Bayat, Reza, et al.
Pubblicazione: (2025)
di: Bayat, Reza, et al.
Pubblicazione: (2025)
Boosting of Thoughts: Trial-and-Error Problem Solving with Large Language Models
di: Chen, Sijia, et al.
Pubblicazione: (2024)
di: Chen, Sijia, et al.
Pubblicazione: (2024)
LRQ: Optimizing Post-Training Quantization for Large Language Models by Learning Low-Rank Weight-Scaling Matrices
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
di: Lee, Jung Hyun, et al.
Pubblicazione: (2024)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
di: Chen, Sihan, et al.
Pubblicazione: (2025)
di: Chen, Sihan, et al.
Pubblicazione: (2025)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
di: He, Liulu, et al.
Pubblicazione: (2025)
di: He, Liulu, et al.
Pubblicazione: (2025)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
di: Han, Bing, et al.
Pubblicazione: (2025)
di: Han, Bing, et al.
Pubblicazione: (2025)
World Models with Hints of Large Language Models for Goal Achieving
di: Liu, Zeyuan, et al.
Pubblicazione: (2024)
di: Liu, Zeyuan, et al.
Pubblicazione: (2024)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
di: Shen, Wei, et al.
Pubblicazione: (2025)
di: Shen, Wei, et al.
Pubblicazione: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Saliency-Aware Regularized Quantization Calibration for Large Language Models
di: Zhao, Yanlong, et al.
Pubblicazione: (2026) -
Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs
di: Cho, Yoonjun, et al.
Pubblicazione: (2026) -
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
di: Zhang, Zhengxin, et al.
Pubblicazione: (2024) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022) -
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
di: Zou, Minghui, et al.
Pubblicazione: (2024)