SliderQuant: Accurate Post-Training Quantization for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Shigeng, Li, Chao, Kang, Yangyuxuan, Fan, Jiawei, Ou, Zhonghong, Yao, Anbang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
par: Fan, Jiawei, et autres
Publié: (2026)
par: Fan, Jiawei, et autres
Publié: (2026)
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
par: Yan, Xianglong, et autres
Publié: (2026)
par: Yan, Xianglong, et autres
Publié: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022)
par: Xiao, Guangxuan, et autres
Publié: (2022)
Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models
par: Li, Chao, et autres
Publié: (2025)
par: Li, Chao, et autres
Publié: (2025)
StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models
par: Hong, Yeona, et autres
Publié: (2025)
par: Hong, Yeona, et autres
Publié: (2025)
NestQuant: Post-Training Integer-Nesting Quantization for On-Device DNN
par: Xie, Jianhang, et autres
Publié: (2025)
par: Xie, Jianhang, et autres
Publié: (2025)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
par: Tang, Hanlin, et autres
Publié: (2024)
par: Tang, Hanlin, et autres
Publié: (2024)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
par: Fan, Jiawei, et autres
Publié: (2024)
par: Fan, Jiawei, et autres
Publié: (2024)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
par: Liu, Wenyuan, et autres
Publié: (2024)
par: Liu, Wenyuan, et autres
Publié: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
par: Shen, Xuan, et autres
Publié: (2023)
par: Shen, Xuan, et autres
Publié: (2023)
DilateQuant: Accurate and Efficient Diffusion Quantization via Weight Dilation
par: Liu, Xuewen, et autres
Publié: (2024)
par: Liu, Xuewen, et autres
Publié: (2024)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
Achieving binary weight and activation for LLMs using Post-Training Quantization
par: Song, Siqing, et autres
Publié: (2025)
par: Song, Siqing, et autres
Publié: (2025)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
par: Zhao, Zhixiong, et autres
Publié: (2025)
par: Zhao, Zhixiong, et autres
Publié: (2025)
One QuantLLM for ALL: Fine-tuning Quantized LLMs Once for Efficient Deployments
par: Yi, Ke, et autres
Publié: (2024)
par: Yi, Ke, et autres
Publié: (2024)
KernelWarehouse: Rethinking the Design of Dynamic Convolution
par: Li, Chao, et autres
Publié: (2024)
par: Li, Chao, et autres
Publié: (2024)
NestQuant: Nested Lattice Quantization for Matrix Products and LLMs
par: Savkin, Semyon, et autres
Publié: (2025)
par: Savkin, Semyon, et autres
Publié: (2025)
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
par: Zhang, Jinghe, et autres
Publié: (2026)
par: Zhang, Jinghe, et autres
Publié: (2026)
FreeSliders: Training-Free, Modality-Agnostic Concept Sliders for Fine-Grained Diffusion Control in Images, Audio, and Video
par: Ezra, Rotem, et autres
Publié: (2025)
par: Ezra, Rotem, et autres
Publié: (2025)
Fast and Accurate Probing of In-Training LLMs' Downstream Performances
par: Liu, Zhichen, et autres
Publié: (2026)
par: Liu, Zhichen, et autres
Publié: (2026)
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
par: Luo, Yingsong, et autres
Publié: (2024)
par: Luo, Yingsong, et autres
Publié: (2024)
Benchmarking Post-Training Quantization in LLMs: Comprehensive Taxonomy, Unified Evaluation, and Comparative Analysis
par: Zhao, Jiaqi, et autres
Publié: (2025)
par: Zhao, Jiaqi, et autres
Publié: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
PolarQuant: Quantizing KV Caches with Polar Transformation
par: Han, Insu, et autres
Publié: (2025)
par: Han, Insu, et autres
Publié: (2025)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
par: Zhao, Zhixiong, et autres
Publié: (2026)
par: Zhao, Zhixiong, et autres
Publié: (2026)
Accurate Block Quantization in LLMs with Outliers
par: Trukhanov, Nikita, et autres
Publié: (2024)
par: Trukhanov, Nikita, et autres
Publié: (2024)
PrivQuant: Communication-Efficient Private Inference with Quantized Network/Protocol Co-Optimization
par: Xu, Tianshi, et autres
Publié: (2024)
par: Xu, Tianshi, et autres
Publié: (2024)
Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs
par: Kurz, Paul Jonas, et autres
Publié: (2026)
par: Kurz, Paul Jonas, et autres
Publié: (2026)
Progressive Fine-to-Coarse Reconstruction for Accurate Low-Bit Post-Training Quantization in Vision Transformers
par: Ding, Rui, et autres
Publié: (2024)
par: Ding, Rui, et autres
Publié: (2024)
3DTurboQuant: Training-Free Near-Optimal Quantization for 3D Reconstruction Models
par: Lee, Jae Joong
Publié: (2026)
par: Lee, Jae Joong
Publié: (2026)
Towards Accurate Post-training Quantization for Reparameterized Models
par: Zhang, Luoming, et autres
Publié: (2024)
par: Zhang, Luoming, et autres
Publié: (2024)
P$^2$-ViT: Power-of-Two Post-Training Quantization and Acceleration for Fully Quantized Vision Transformer
par: Shi, Huihong, et autres
Publié: (2024)
par: Shi, Huihong, et autres
Publié: (2024)
QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals
par: Zhang, Nan, et autres
Publié: (2026)
par: Zhang, Nan, et autres
Publié: (2026)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models
par: Liu, Yifei, et autres
Publié: (2024)
par: Liu, Yifei, et autres
Publié: (2024)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
Documents similaires
-
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
par: Fan, Jiawei, et autres
Publié: (2026) -
D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs
par: Yan, Xianglong, et autres
Publié: (2026) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022) -
Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models
par: Li, Chao, et autres
Publié: (2025) -
StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models
par: Hong, Yeona, et autres
Publié: (2025)