QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jing, Gong, Ruihao, Wei, Xiuying, Dong, Zhiwei, Cai, Jianfei, Zhuang, Bohan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models
par: Liu, Jing, et autres
Publié: (2024)
par: Liu, Jing, et autres
Publié: (2024)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
par: Chen, Zhuokun, et autres
Publié: (2026)
par: Chen, Zhuokun, et autres
Publié: (2026)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
par: Gong, Ruihao, et autres
Publié: (2024)
par: Gong, Ruihao, et autres
Publié: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022)
par: Xiao, Guangxuan, et autres
Publié: (2022)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
par: Chen, Zhuokun, et autres
Publié: (2025)
par: Chen, Zhuokun, et autres
Publié: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
Are Large Vision Language Models Good Game Players?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
A Survey of Low-bit Large Language Models: Basics, Systems, and Algorithms
par: Gong, Ruihao, et autres
Publié: (2024)
par: Gong, Ruihao, et autres
Publié: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
par: Zhou, Chenxi, et autres
Publié: (2025)
par: Zhou, Chenxi, et autres
Publié: (2025)
Sparsity Induction for Accurate Post-Training Pruning of Large Language Models
par: Jiang, Minhao, et autres
Publié: (2026)
par: Jiang, Minhao, et autres
Publié: (2026)
Evaluating Quantized Large Language Models
par: Li, Shiyao, et autres
Publié: (2024)
par: Li, Shiyao, et autres
Publié: (2024)
StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths
par: Chen, Tianyi, et autres
Publié: (2026)
par: Chen, Tianyi, et autres
Publié: (2026)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
par: Jin, Renren, et autres
Publié: (2024)
par: Jin, Renren, et autres
Publié: (2024)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2025)
par: Wang, Xinyuan, et autres
Publié: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
Catching Chameleons: Detecting Evolving Disinformation Generated using Large Language Models
par: Jiang, Bohan, et autres
Publié: (2024)
par: Jiang, Bohan, et autres
Publié: (2024)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
XGrammar: Flexible and Efficient Structured Generation Engine for Large Language Models
par: Dong, Yixin, et autres
Publié: (2024)
par: Dong, Yixin, et autres
Publié: (2024)
Pre-trained Large Language Models for Financial Sentiment Analysis
par: Luo, Wei, et autres
Publié: (2024)
par: Luo, Wei, et autres
Publié: (2024)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
par: Zheng, Xingyu, et autres
Publié: (2025)
par: Zheng, Xingyu, et autres
Publié: (2025)
ROSAQ: Rotation-based Saliency-Aware Weight Quantization for Efficiently Compressing Large Language Models
par: Yoon, Junho, et autres
Publié: (2025)
par: Yoon, Junho, et autres
Publié: (2025)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
par: He, Zhenghao, et autres
Publié: (2026)
par: He, Zhenghao, et autres
Publié: (2026)
When Quantization Affects Confidence of Large Language Models?
par: Proskurina, Irina, et autres
Publié: (2024)
par: Proskurina, Irina, et autres
Publié: (2024)
DLLMQuant: Quantizing Diffusion-based Large Language Models
par: Xu, Chen, et autres
Publié: (2025)
par: Xu, Chen, et autres
Publié: (2025)
IoT-LLM: a framework for enhancing Large Language Model reasoning from real-world sensor data
par: An, Tuo, et autres
Publié: (2024)
par: An, Tuo, et autres
Publié: (2024)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
par: Huang, Weiyu, et autres
Publié: (2024)
par: Huang, Weiyu, et autres
Publié: (2024)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
par: Liu, Dong, et autres
Publié: (2025)
par: Liu, Dong, et autres
Publié: (2025)
R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
par: Chen, Jiayi, et autres
Publié: (2025)
par: Chen, Jiayi, et autres
Publié: (2025)
Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models
par: Wu, Canhui, et autres
Publié: (2025)
par: Wu, Canhui, et autres
Publié: (2025)
On the Compressibility of Quantized Large Language Models
par: Mao, Yu, et autres
Publié: (2024)
par: Mao, Yu, et autres
Publié: (2024)
Channel-Wise Mixed-Precision Quantization for Large Language Models
par: Chen, Zihan, et autres
Publié: (2024)
par: Chen, Zihan, et autres
Publié: (2024)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
PQS (Prune, Quantize, and Sort): Low-Bitwidth Accumulation of Dot Products in Neural Network Computations
par: Natesh, Vikas, et autres
Publié: (2025)
par: Natesh, Vikas, et autres
Publié: (2025)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
par: Zhan, Zaifu, et autres
Publié: (2025)
par: Zhan, Zaifu, et autres
Publié: (2025)
Low-Confidence Gold: Refining Low-Confidence Samples for Efficient Instruction Tuning
par: Cai, Hongyi, et autres
Publié: (2025)
par: Cai, Hongyi, et autres
Publié: (2025)
Fault Diagnosis in Power Grids with Large Language Model
par: Jing, Liu, et autres
Publié: (2024)
par: Jing, Liu, et autres
Publié: (2024)
Flexora: Flexible Low Rank Adaptation for Large Language Models
par: Wei, Chenxing, et autres
Publié: (2024)
par: Wei, Chenxing, et autres
Publié: (2024)
IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
par: Liu, Ruikang, et autres
Publié: (2024)
par: Liu, Ruikang, et autres
Publié: (2024)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
Documents similaires
-
ME-Switch: A Memory-Efficient Expert Switching Framework for Large Language Models
par: Liu, Jing, et autres
Publié: (2024) -
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
par: Chen, Zhuokun, et autres
Publié: (2026) -
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
par: Gong, Ruihao, et autres
Publié: (2024) -
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022) -
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)