On the Compressibility of Quantized Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mao, Yu, Wang, Weilan, Du, Hongchao, Guan, Nan, Xue, Chun Jason |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
von: Wang, Weilan, et al.
Veröffentlicht: (2025)
von: Wang, Weilan, et al.
Veröffentlicht: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
von: Gong, Ruihao, et al.
Veröffentlicht: (2024)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
von: Guan, Ziyi, et al.
Veröffentlicht: (2024)
von: Guan, Ziyi, et al.
Veröffentlicht: (2024)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
von: Mao, Yu, et al.
Veröffentlicht: (2025)
von: Mao, Yu, et al.
Veröffentlicht: (2025)
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
von: He, Liulu, et al.
Veröffentlicht: (2025)
von: He, Liulu, et al.
Veröffentlicht: (2025)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
von: Li, Jia-Nan, et al.
Veröffentlicht: (2025)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
von: Oliver, Michael, et al.
Veröffentlicht: (2024)
GWQ: Gradient-Aware Weight Quantization for Large Language Models
von: Shao, Yihua, et al.
Veröffentlicht: (2024)
von: Shao, Yihua, et al.
Veröffentlicht: (2024)
In-context Autoencoder for Context Compression in a Large Language Model
von: Ge, Tao, et al.
Veröffentlicht: (2023)
von: Ge, Tao, et al.
Veröffentlicht: (2023)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
GPTQT: Quantize Large Language Models Twice to Push the Efficiency
von: Guo, Yipin, et al.
Veröffentlicht: (2024)
von: Guo, Yipin, et al.
Veröffentlicht: (2024)
A Comprehensive Study on Quantization Techniques for Large Language Models
von: Lang, Jiedong, et al.
Veröffentlicht: (2024)
von: Lang, Jiedong, et al.
Veröffentlicht: (2024)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2025)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
von: Zhou, Longsheng, et al.
Veröffentlicht: (2026)
von: Zhou, Longsheng, et al.
Veröffentlicht: (2026)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
von: Zou, Minghui, et al.
Veröffentlicht: (2024)
von: Zou, Minghui, et al.
Veröffentlicht: (2024)
Interactions Across Blocks in Post-Training Quantization of Large Language Models
von: Shabanovi, Khasmamad, et al.
Veröffentlicht: (2024)
von: Shabanovi, Khasmamad, et al.
Veröffentlicht: (2024)
QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models
von: Liu, Jing, et al.
Veröffentlicht: (2023)
von: Liu, Jing, et al.
Veröffentlicht: (2023)
SiLQ: Simple Large Language Model Quantization-Aware Training
von: Esser, Steven K., et al.
Veröffentlicht: (2025)
von: Esser, Steven K., et al.
Veröffentlicht: (2025)
Clustering-driven Memory Compression for On-device Large Language Models
von: Bohdal, Ondrej, et al.
Veröffentlicht: (2026)
von: Bohdal, Ondrej, et al.
Veröffentlicht: (2026)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
von: Hu, Xing, et al.
Veröffentlicht: (2024)
von: Hu, Xing, et al.
Veröffentlicht: (2024)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
von: Xiao, Guangxuan, et al.
Veröffentlicht: (2022)
von: Xiao, Guangxuan, et al.
Veröffentlicht: (2022)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
von: Wang, Qianli, et al.
Veröffentlicht: (2026)
von: Wang, Qianli, et al.
Veröffentlicht: (2026)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
von: Zhang, Yi, et al.
Veröffentlicht: (2024)
von: Zhang, Yi, et al.
Veröffentlicht: (2024)
PAT: Pruning-Aware Tuning for Large Language Models
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
von: Liu, Yijiang, et al.
Veröffentlicht: (2024)
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models
von: Li, Hongji, et al.
Veröffentlicht: (2025)
von: Li, Hongji, et al.
Veröffentlicht: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
von: Yue, Yuxuan, et al.
Veröffentlicht: (2024)
von: Yue, Yuxuan, et al.
Veröffentlicht: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
von: Park, Jungwoo, et al.
Veröffentlicht: (2025)
von: Park, Jungwoo, et al.
Veröffentlicht: (2025)
All Language Models Large and Small
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
A Survey on LoRA of Large Language Models
von: Mao, Yuren, et al.
Veröffentlicht: (2024)
von: Mao, Yuren, et al.
Veröffentlicht: (2024)
Quantization Dominates Rank Reduction for KV-Cache Compression
von: Salfati, Samuel
Veröffentlicht: (2026)
von: Salfati, Samuel
Veröffentlicht: (2026)
Liger: Linearizing Large Language Models to Gated Recurrent Structures
von: Lan, Disen, et al.
Veröffentlicht: (2025)
von: Lan, Disen, et al.
Veröffentlicht: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
von: Chen, Haozhe, et al.
Veröffentlicht: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024)
von: Liu, Akide, et al.
Veröffentlicht: (2024)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
von: Xiong, Boya, et al.
Veröffentlicht: (2025)
von: Xiong, Boya, et al.
Veröffentlicht: (2025)
Optimizing Large Language Models through Quantization: A Comparative Analysis of PTQ and QAT Techniques
von: Hasan, Jahid
Veröffentlicht: (2024)
von: Hasan, Jahid
Veröffentlicht: (2024)
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
von: Lee, Sangjun, et al.
Veröffentlicht: (2025)
von: Lee, Sangjun, et al.
Veröffentlicht: (2025)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
von: Ananta, Moses, et al.
Veröffentlicht: (2025)
von: Ananta, Moses, et al.
Veröffentlicht: (2025)
A Survey of Quantized Graph Representation Learning: Connecting Graph Structures with Large Language Models
von: Lin, Qika, et al.
Veröffentlicht: (2025)
von: Lin, Qika, et al.
Veröffentlicht: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
von: Wang, Yanshu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
von: Wang, Weilan, et al.
Veröffentlicht: (2025) -
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
von: Gong, Ruihao, et al.
Veröffentlicht: (2024) -
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
von: Guan, Ziyi, et al.
Veröffentlicht: (2024) -
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
von: Mao, Yu, et al.
Veröffentlicht: (2025) -
BASE-Q: Bias and Asymmetric Scaling Enhanced Rotational Quantization for Large Language Models
von: He, Liulu, et al.
Veröffentlicht: (2025)