AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Ji, Tang, Jiaming, Tang, Haotian, Yang, Shang, Chen, Wei-Ming, Wang, Wei-Chen, Xiao, Guangxuan, Dang, Xingyu, Gan, Chuang, Han, Song |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024)
par: Lin, Yujun, et autres
Publié: (2024)
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
par: Xiao, Guangxuan, et autres
Publié: (2024)
par: Xiao, Guangxuan, et autres
Publié: (2024)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
par: Yang, Shang, et autres
Publié: (2025)
par: Yang, Shang, et autres
Publié: (2025)
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
par: Tang, Jiaming, et autres
Publié: (2024)
par: Tang, Jiaming, et autres
Publié: (2024)
MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning
par: Lin, Ji, et autres
Publié: (2021)
par: Lin, Ji, et autres
Publié: (2021)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
par: Xiao, Guangxuan, et autres
Publié: (2022)
par: Xiao, Guangxuan, et autres
Publié: (2022)
On-Device Training Under 256KB Memory
par: Lin, Ji, et autres
Publié: (2022)
par: Lin, Ji, et autres
Publié: (2022)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
par: Yu, Xiaoming, et autres
Publié: (2026)
par: Yu, Xiaoming, et autres
Publié: (2026)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
par: Guo, Cong, et autres
Publié: (2025)
par: Guo, Cong, et autres
Publié: (2025)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
par: Chen, Junyu, et autres
Publié: (2024)
par: Chen, Junyu, et autres
Publié: (2024)
ExCP: Extreme LLM Checkpoint Compression via Weight-Momentum Joint Shrinking
par: Li, Wenshuo, et autres
Publié: (2024)
par: Li, Wenshuo, et autres
Publié: (2024)
Neural Image Compression with Quantization Rectifier
par: Luo, Wei, et autres
Publié: (2024)
par: Luo, Wei, et autres
Publié: (2024)
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
par: Qiao, Ye, et autres
Publié: (2026)
par: Qiao, Ye, et autres
Publié: (2026)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
par: Hooper, Coleman, et autres
Publié: (2025)
par: Hooper, Coleman, et autres
Publié: (2025)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
par: Zhao, Yilong, et autres
Publié: (2025)
par: Zhao, Yilong, et autres
Publié: (2025)
Quantization Meets OOD: Generalizable Quantization-aware Training from a Flatness Perspective
par: Jiang, Jiacheng, et autres
Publié: (2025)
par: Jiang, Jiacheng, et autres
Publié: (2025)
Efficient Streaming Language Models with Attention Sinks
par: Xiao, Guangxuan, et autres
Publié: (2023)
par: Xiao, Guangxuan, et autres
Publié: (2023)
ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models
par: Yuan, Zhihang, et autres
Publié: (2023)
par: Yuan, Zhihang, et autres
Publié: (2023)
Optimizing Mixture of Block Attention
par: Xiao, Guangxuan, et autres
Publié: (2025)
par: Xiao, Guangxuan, et autres
Publié: (2025)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
par: Zhou, Wenyong, et autres
Publié: (2025)
par: Zhou, Wenyong, et autres
Publié: (2025)
Tiny Machine Learning: Progress and Futures
par: Lin, Ji, et autres
Publié: (2024)
par: Lin, Ji, et autres
Publié: (2024)
Optimal Quantized Compressed Sensing via Projected Gradient Descent
par: Chen, Junren, et autres
Publié: (2024)
par: Chen, Junren, et autres
Publié: (2024)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
par: Duan, Bowen, et autres
Publié: (2026)
par: Duan, Bowen, et autres
Publié: (2026)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
par: Tang, Haocheng, et autres
Publié: (2026)
par: Tang, Haocheng, et autres
Publié: (2026)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
par: IslamBouli, Beshr, et autres
Publié: (2026)
par: IslamBouli, Beshr, et autres
Publié: (2026)
Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression
par: Jiang, Shiyin, et autres
Publié: (2026)
par: Jiang, Shiyin, et autres
Publié: (2026)
AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
Weighted Nested Commutators for Scalable Counterdiabatic State Preparation
par: Tang, Jialiang, et autres
Publié: (2026)
par: Tang, Jialiang, et autres
Publié: (2026)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
par: Xu, Ruyi, et autres
Publié: (2025)
par: Xu, Ruyi, et autres
Publié: (2025)
QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition
par: Hu, Yuxuan, et autres
Publié: (2025)
par: Hu, Yuxuan, et autres
Publié: (2025)
Quantization-aware Matrix Factorization for Low Bit Rate Image Compression
par: Ashtari, Pooya, et autres
Publié: (2024)
par: Ashtari, Pooya, et autres
Publié: (2024)
Post-training Quantization for Text-to-Image Diffusion Models with Progressive Calibration and Activation Relaxing
par: Tang, Siao, et autres
Publié: (2023)
par: Tang, Siao, et autres
Publié: (2023)
Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
par: Cook, Jack, et autres
Publié: (2025)
par: Cook, Jack, et autres
Publié: (2025)
AMC: AutoML for Model Compression and Acceleration on Mobile Devices
par: He, Yihui, et autres
Publié: (2018)
par: He, Yihui, et autres
Publié: (2018)
Investigation of Wheel‐Rail Adhesion Performance Under Water‐Contaminated Conditions Considering Interface Geometry
par: Congcong Fang, et autres
Publié: (2026)
par: Congcong Fang, et autres
Publié: (2026)
TTQ: Activation-Aware Test-Time Quantization to Accelerate LLM Inference On The Fly
par: Koike-Akino, Toshiaki, et autres
Publié: (2026)
par: Koike-Akino, Toshiaki, et autres
Publié: (2026)
Accelerating Parallel Diffusion Model Serving with Residual Compression
par: Luo, Jiajun, et autres
Publié: (2025)
par: Luo, Jiajun, et autres
Publié: (2025)
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
par: Vicentino, Caio
Publié: (2026)
par: Vicentino, Caio
Publié: (2026)
A three-term Polak-Ribière-Polyak conjugate gradient method for vector optimization
par: Lin, Guangxuan, et autres
Publié: (2025)
par: Lin, Guangxuan, et autres
Publié: (2025)
FreeAct: Freeing Activations for LLM Quantization
par: Liu, Xiaohao, et autres
Publié: (2026)
par: Liu, Xiaohao, et autres
Publié: (2026)
Documents similaires
-
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024) -
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
par: Xiao, Guangxuan, et autres
Publié: (2024) -
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
par: Yang, Shang, et autres
Publié: (2025) -
Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference
par: Tang, Jiaming, et autres
Publié: (2024) -
MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning
par: Lin, Ji, et autres
Publié: (2021)