First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zheng, Xingyu, Qin, Haotong, Li, Yuye, Chu, Haoran, Wang, Jiakai, Guo, Jinyang, Magno, Michele, Liu, Xianglong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BinaryDM: Accurate Weight Binarization for Efficient Diffusion Models
by: Zheng, Xingyu, et al.
Published: (2024)
by: Zheng, Xingyu, et al.
Published: (2024)
BiDM: Pushing the Limit of Quantization for Diffusion Models
by: Zheng, Xingyu, et al.
Published: (2024)
by: Zheng, Xingyu, et al.
Published: (2024)
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
by: Qin, Haotong, et al.
Published: (2024)
by: Qin, Haotong, et al.
Published: (2024)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
by: Gong, Ruihao, et al.
Published: (2024)
by: Gong, Ruihao, et al.
Published: (2024)
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
by: Qin, Haotong, et al.
Published: (2026)
by: Qin, Haotong, et al.
Published: (2026)
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
by: Huang, Wei, et al.
Published: (2024)
by: Huang, Wei, et al.
Published: (2024)
An Empirical Study of Qwen3 Quantization
by: Zheng, Xingyu, et al.
Published: (2025)
by: Zheng, Xingyu, et al.
Published: (2025)
BiVM: Accurate Binarized Neural Network for Efficient Video Matting
by: Qin, Haotong, et al.
Published: (2025)
by: Qin, Haotong, et al.
Published: (2025)
Q-SAM2: Accurate Quantization for Segment Anything Model 2
by: Farronato, Nicola, et al.
Published: (2025)
by: Farronato, Nicola, et al.
Published: (2025)
Event-Priori-Based Vision-Language Model for Efficient Visual Understanding
by: Qin, Haotong, et al.
Published: (2025)
by: Qin, Haotong, et al.
Published: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
by: Huang, Wei, et al.
Published: (2024)
by: Huang, Wei, et al.
Published: (2024)
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
by: Chen, Yujie, et al.
Published: (2025)
by: Chen, Yujie, et al.
Published: (2025)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
by: Huang, Yushi, et al.
Published: (2025)
by: Huang, Yushi, et al.
Published: (2025)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
by: Yang, Ge, et al.
Published: (2024)
by: Yang, Ge, et al.
Published: (2024)
Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers
by: Feng, Weilun, et al.
Published: (2025)
by: Feng, Weilun, et al.
Published: (2025)
ARB-LLM: Alternating Refined Binarizations for Large Language Models
by: Li, Zhiteng, et al.
Published: (2024)
by: Li, Zhiteng, et al.
Published: (2024)
Post-Training Quantization for Video Matting
by: Zhu, Tianrui, et al.
Published: (2025)
by: Zhu, Tianrui, et al.
Published: (2025)
S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
by: Feng, Weilun, et al.
Published: (2025)
by: Feng, Weilun, et al.
Published: (2025)
AdaSVD: Adaptive Singular Value Decomposition for Large Language Models
by: Li, Zhiteng, et al.
Published: (2025)
by: Li, Zhiteng, et al.
Published: (2025)
Minimize Quantization Output Error with Bias Compensation
by: Gong, Cheng, et al.
Published: (2024)
by: Gong, Cheng, et al.
Published: (2024)
DB-LLM: Accurate Dual-Binarization for Efficient LLMs
by: Chen, Hong, et al.
Published: (2024)
by: Chen, Hong, et al.
Published: (2024)
BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design
by: Ding, Yifu, et al.
Published: (2026)
by: Ding, Yifu, et al.
Published: (2026)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
by: Shao, Yihua, et al.
Published: (2024)
by: Shao, Yihua, et al.
Published: (2024)
PicoSAM2: Low-Latency Segmentation In-Sensor for Edge Vision Applications
by: Bonazzi, Pietro, et al.
Published: (2025)
by: Bonazzi, Pietro, et al.
Published: (2025)
PicoSAM3: Real-Time In-Sensor Region-of-Interest Segmentation
by: Bonazzi, Pietro, et al.
Published: (2026)
by: Bonazzi, Pietro, et al.
Published: (2026)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
by: Xu, Runsen, et al.
Published: (2025)
by: Xu, Runsen, et al.
Published: (2025)
PTQ4SAM: Post-Training Quantization for Segment Anything
by: Lv, Chengtao, et al.
Published: (2024)
by: Lv, Chengtao, et al.
Published: (2024)
Large Language Models Still Face Challenges in Multi-Hop Reasoning with External Knowledge
by: Zhang, Haotong
Published: (2024)
by: Zhang, Haotong
Published: (2024)
Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective
by: Ma, Xiaorui, et al.
Published: (2025)
by: Ma, Xiaorui, et al.
Published: (2025)
Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners
by: Gao, Yifei, et al.
Published: (2024)
by: Gao, Yifei, et al.
Published: (2024)
Quantized Visual Geometry Grounded Transformer
by: Feng, Weilun, et al.
Published: (2025)
by: Feng, Weilun, et al.
Published: (2025)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
by: Zhong, Yi, et al.
Published: (2026)
by: Zhong, Yi, et al.
Published: (2026)
RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization
by: Yang, Kaicheng, et al.
Published: (2025)
by: Yang, Kaicheng, et al.
Published: (2025)
DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization
by: Lin, Haokun, et al.
Published: (2026)
by: Lin, Haokun, et al.
Published: (2026)
MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models
by: Feng, Weilun, et al.
Published: (2024)
by: Feng, Weilun, et al.
Published: (2024)
Exploring Multimodal Large Language Models for Radiology Report Error-checking
by: Wu, Jinge, et al.
Published: (2023)
by: Wu, Jinge, et al.
Published: (2023)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
by: Zhao, Qinyu, et al.
Published: (2024)
by: Zhao, Qinyu, et al.
Published: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
by: Xu, Shilin, et al.
Published: (2024)
by: Xu, Shilin, et al.
Published: (2024)
To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models
by: Lin, Junyan, et al.
Published: (2024)
by: Lin, Junyan, et al.
Published: (2024)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
by: Huang, Wenjun, et al.
Published: (2024)
by: Huang, Wenjun, et al.
Published: (2024)
Similar Items
-
BinaryDM: Accurate Weight Binarization for Efficient Diffusion Models
by: Zheng, Xingyu, et al.
Published: (2024) -
BiDM: Pushing the Limit of Quantization for Diffusion Models
by: Zheng, Xingyu, et al.
Published: (2024) -
Accurate LoRA-Finetuning Quantization of LLMs via Information Retention
by: Qin, Haotong, et al.
Published: (2024) -
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
by: Gong, Ruihao, et al.
Published: (2024) -
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
by: Qin, Haotong, et al.
Published: (2026)