What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gong, Zhuocheng, Liu, Jiahao, Wang, Jingang, Cai, Xunliang, Zhao, Dongyan, Yan, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling and Transferability of Annealing Strategies in Large Language Model Training
par: Wang, Siqi, et autres
Publié: (2025)
par: Wang, Siqi, et autres
Publié: (2025)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
par: Wu, Pengfei, et autres
Publié: (2024)
par: Wu, Pengfei, et autres
Publié: (2024)
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
par: He, Chen, et autres
Publié: (2025)
par: He, Chen, et autres
Publié: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
par: Diao, Muxi, et autres
Publié: (2024)
par: Diao, Muxi, et autres
Publié: (2024)
Tequila: Trapping-free Ternary Quantization for Large Language Models
par: Huang, Hong, et autres
Publié: (2025)
par: Huang, Hong, et autres
Publié: (2025)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
par: Liu, Wenyuan, et autres
Publié: (2024)
par: Liu, Wenyuan, et autres
Publié: (2024)
Deconstructing What Makes a Good Optimizer for Language Models
par: Zhao, Rosie, et autres
Publié: (2024)
par: Zhao, Rosie, et autres
Publié: (2024)
Causal Pre-training Under the Fairness Lens: An Empirical Study of TabPFN
par: Liu, Qinyi, et autres
Publié: (2026)
par: Liu, Qinyi, et autres
Publié: (2026)
Saliency-Aware Regularized Quantization Calibration for Large Language Models
par: Zhao, Yanlong, et autres
Publié: (2026)
par: Zhao, Yanlong, et autres
Publié: (2026)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
FIRP: Faster LLM inference via future intermediate representation prediction
par: Wu, Pengfei, et autres
Publié: (2024)
par: Wu, Pengfei, et autres
Publié: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
par: Shao, Yihua, et autres
Publié: (2024)
par: Shao, Yihua, et autres
Publié: (2024)
Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
par: Kong, Deyang, et autres
Publié: (2025)
par: Kong, Deyang, et autres
Publié: (2025)
Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs
par: Chen, Zhengyu, et autres
Publié: (2025)
par: Chen, Zhengyu, et autres
Publié: (2025)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Causal-aware Large Language Models: Enhancing Decision-Making Through Learning, Adapting and Acting
par: Chen, Wei, et autres
Publié: (2025)
par: Chen, Wei, et autres
Publié: (2025)
Understanding Hardness of Vision-Language Compositionality from A Token-level Causal Lens
par: Chen, Ziliang, et autres
Publié: (2025)
par: Chen, Ziliang, et autres
Publié: (2025)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
par: Liu, Wenyuan, et autres
Publié: (2025)
par: Liu, Wenyuan, et autres
Publié: (2025)
What Makes Looped Transformers Perform Better Than Non-Recursive Ones
par: Gong, Zixuan, et autres
Publié: (2025)
par: Gong, Zixuan, et autres
Publié: (2025)
QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models
par: Zhou, Jiajun, et autres
Publié: (2025)
par: Zhou, Jiajun, et autres
Publié: (2025)
ASER: Activation Smoothing and Error Reconstruction for Large Language Model Quantization
par: Zhao, Weibo, et autres
Publié: (2024)
par: Zhao, Weibo, et autres
Publié: (2024)
Analyzing Memorization in Large Language Models through the Lens of Model Attribution
par: Menta, Tarun Ram, et autres
Publié: (2025)
par: Menta, Tarun Ram, et autres
Publié: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
par: Gong, Ruihao, et autres
Publié: (2024)
par: Gong, Ruihao, et autres
Publié: (2024)
A Comprehensive Study on Quantization Techniques for Large Language Models
par: Lang, Jiedong, et autres
Publié: (2024)
par: Lang, Jiedong, et autres
Publié: (2024)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
par: Wang, Siqi, et autres
Publié: (2024)
par: Wang, Siqi, et autres
Publié: (2024)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
GANQ: GPU-Adaptive Non-Uniform Quantization for Large Language Models
par: Zhao, Pengxiang, et autres
Publié: (2025)
par: Zhao, Pengxiang, et autres
Publié: (2025)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
par: Kim, Sunghwan, et autres
Publié: (2026)
par: Kim, Sunghwan, et autres
Publié: (2026)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
S^3cMath: Spontaneous Step-level Self-correction Makes Large Language Models Better Mathematical Reasoners
par: Yan, Yuchen, et autres
Publié: (2024)
par: Yan, Yuchen, et autres
Publié: (2024)
VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation
par: Zhai, Linwei, et autres
Publié: (2026)
par: Zhai, Linwei, et autres
Publié: (2026)
ARO: A New Lens On Matrix Optimization For Large Models
par: Gong, Wenbo, et autres
Publié: (2026)
par: Gong, Wenbo, et autres
Publié: (2026)
Post Training Quantization of Large Language Models with Microscaling Formats
par: Sharify, Sayeh, et autres
Publié: (2024)
par: Sharify, Sayeh, et autres
Publié: (2024)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models
par: Zhang, Zhengxin, et autres
Publié: (2024)
par: Zhang, Zhengxin, et autres
Publié: (2024)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
par: Zhang, Tianao, et autres
Publié: (2025)
par: Zhang, Tianao, et autres
Publié: (2025)
Documents similaires
-
Scaling and Transferability of Annealing Strategies in Large Language Model Training
par: Wang, Siqi, et autres
Publié: (2025) -
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
par: Wu, Pengfei, et autres
Publié: (2024) -
Graph-Structured Speculative Decoding
par: Gong, Zhuocheng, et autres
Publié: (2024) -
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
par: Liu, Jing, et autres
Publié: (2023) -
What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
par: He, Chen, et autres
Publié: (2025)