Why Do Some Inputs Break Low-Bit LLM Quantization?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Ting-Yun, Zhang, Muru, Thomason, Jesse, Jia, Robin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM Unlearning Without an Expert Curated Dataset
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
par: Zhang, Xi, et autres
Publié: (2025)
par: Zhang, Xi, et autres
Publié: (2025)
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
Breaking the Blocks: Continuous Low-Rank Decomposed Scaling for Unified LLM Quantization and Adaptation
par: Tang, Pingzhi, et autres
Publié: (2026)
par: Tang, Pingzhi, et autres
Publié: (2026)
Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2025)
par: Hu, Zizhao, et autres
Publié: (2025)
Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
par: Lee, Deokjae, et autres
Publié: (2025)
par: Lee, Deokjae, et autres
Publié: (2025)
SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion
par: Hu, Zizhao, et autres
Publié: (2026)
par: Hu, Zizhao, et autres
Publié: (2026)
LittleBit: Ultra Low-Bit Quantization via Latent Factorization
par: Lee, Banseok, et autres
Publié: (2025)
par: Lee, Banseok, et autres
Publié: (2025)
When Bits Break Recourse: Counterfactual-Faithful Quantization
par: Yahyati, Chaymae, et autres
Publié: (2026)
par: Yahyati, Chaymae, et autres
Publié: (2026)
BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization
par: Zhao, Jiayu, et autres
Publié: (2026)
par: Zhao, Jiayu, et autres
Publié: (2026)
SplitQuant: Layer Splitting for Low-Bit Neural Network Quantization
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
M3PT: A Transformer for Multimodal, Multi-Party Social Signal Prediction with Person-aware Blockwise Attention
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
HeRo-Q: A General Framework for Stable Low Bit Quantization via Hessian Conditioning
par: Zhang, Jinhao Zhang Yunquan, et autres
Publié: (2026)
par: Zhang, Jinhao Zhang Yunquan, et autres
Publié: (2026)
ECQ$^{\text{x}}$: Explainability-Driven Quantization for Low-Bit and Sparse DNNs
par: Becking, Daniel, et autres
Publié: (2021)
par: Becking, Daniel, et autres
Publié: (2021)
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
par: Zou, Sunan, et autres
Publié: (2025)
par: Zou, Sunan, et autres
Publié: (2025)
Quantization Variation: A New Perspective on Training Transformers with Low-Bit Precision
par: Huang, Xijie, et autres
Publié: (2023)
par: Huang, Xijie, et autres
Publié: (2023)
SplitQuantV2: Enhancing Low-Bit Quantization of LLMs Without GPUs
par: Song, Jaewoo, et autres
Publié: (2025)
par: Song, Jaewoo, et autres
Publié: (2025)
Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization
par: Zhao, Zhixiong, et autres
Publié: (2025)
par: Zhao, Zhixiong, et autres
Publié: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
Attn-QAT: 4-Bit Attention With Quantization-Aware Training
par: Zhang, Peiyuan, et autres
Publié: (2026)
par: Zhang, Peiyuan, et autres
Publié: (2026)
PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models
par: Zhao, Jiaqi, et autres
Publié: (2025)
par: Zhao, Jiaqi, et autres
Publié: (2025)
NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
par: Son, Donghyun, et autres
Publié: (2025)
par: Son, Donghyun, et autres
Publié: (2025)
HESTIA: A Hessian-Guided Differentiable Quantization-Aware Training Framework for Extremely Low-Bit LLMs
par: Wang, Guoan, et autres
Publié: (2026)
par: Wang, Guoan, et autres
Publié: (2026)
Exploiting LLM Quantization
par: Egashira, Kazuki, et autres
Publié: (2024)
par: Egashira, Kazuki, et autres
Publié: (2024)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
par: Zhang, Junkai, et autres
Publié: (2026)
par: Zhang, Junkai, et autres
Publié: (2026)
AdaQAT: Adaptive Bit-Width Quantization-Aware Training
par: Gernigon, Cédric, et autres
Publié: (2024)
par: Gernigon, Cédric, et autres
Publié: (2024)
Widening the Gap: Exploiting LLM Quantization via Outlier Injection
par: Zhan, Xiaohua, et autres
Publié: (2026)
par: Zhan, Xiaohua, et autres
Publié: (2026)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
par: Wang, Dongwei, et autres
Publié: (2026)
par: Wang, Dongwei, et autres
Publié: (2026)
AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer-Wise Asymmetric Quantization Configurations
par: Tao, Qian, et autres
Publié: (2024)
par: Tao, Qian, et autres
Publié: (2024)
Why Does RLAIF Work At All?
par: Young, Robin
Publié: (2026)
par: Young, Robin
Publié: (2026)
HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs
par: Chen, Ningning, et autres
Publié: (2025)
par: Chen, Ningning, et autres
Publié: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
ICQuant: Index Coding enables Low-bit LLM Quantization
par: Li, Xinlin, et autres
Publié: (2025)
par: Li, Xinlin, et autres
Publié: (2025)
Pioneering 4-Bit FP Quantization for Diffusion Models: Mixup-Sign Quantization and Timestep-Aware Fine-Tuning
par: Zhao, Maosen, et autres
Publié: (2025)
par: Zhao, Maosen, et autres
Publié: (2025)
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
par: Pavlov, Gorgi
Publié: (2026)
par: Pavlov, Gorgi
Publié: (2026)
Verification of Bit-Flip Attacks against Quantized Neural Networks
par: Zhang, Yedi, et autres
Publié: (2025)
par: Zhang, Yedi, et autres
Publié: (2025)
MARR: Module-Adaptive Residual Reconstruction for Low-Bit Post-Training Quantization
par: Su, Le, et autres
Publié: (2026)
par: Su, Le, et autres
Publié: (2026)
Every Bit Counts: A Theoretical Study of Precision-Expressivity Tradeoffs in Quantized Transformers
par: Chakrabarti, Sayak, et autres
Publié: (2026)
par: Chakrabarti, Sayak, et autres
Publié: (2026)
Documents similaires
-
LLM Unlearning Without an Expert Curated Dataset
par: Zhu, Xiaoyuan, et autres
Publié: (2025) -
Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
par: Zhang, Xi, et autres
Publié: (2025) -
InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization
par: Li, Ke, et autres
Publié: (2026) -
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025) -
Breaking the Blocks: Continuous Low-Rank Decomposed Scaling for Unified LLM Quantization and Adaptation
par: Tang, Pingzhi, et autres
Publié: (2026)