InnerQ: Hardware-Aware Tuning-Free Quantization of KV Cache for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hosseini, Sayed Mohammadreza Tayaranian, Ardakani, Amir, Gross, Warren J. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
par: Jeon, Hyesung, et autres
Publié: (2024)
par: Jeon, Hyesung, et autres
Publié: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
par: Shi, Dachuan, et autres
Publié: (2025)
par: Shi, Dachuan, et autres
Publié: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression
par: Ji, Zhongping
Publié: (2026)
par: Ji, Zhongping
Publié: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models
par: Duanmu, Haojie, et autres
Publié: (2024)
par: Duanmu, Haojie, et autres
Publié: (2024)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
par: Liu, Sihao, et autres
Publié: (2026)
par: Liu, Sihao, et autres
Publié: (2026)
NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics
par: Cai, Zhihang, et autres
Publié: (2025)
par: Cai, Zhihang, et autres
Publié: (2025)
H1B-KV: Hybrid One-Bit Caches for Memory-Efficient Large Language Model Inference
par: Vejendla, Harshil
Publié: (2025)
par: Vejendla, Harshil
Publié: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
ApiQ: Finetuning of 2-Bit Quantized Large Language Model
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
par: Dong, Zican, et autres
Publié: (2026)
par: Dong, Zican, et autres
Publié: (2026)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
par: Li, Yucheng, et autres
Publié: (2024)
par: Li, Yucheng, et autres
Publié: (2024)
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026)
par: Su, Yi, et autres
Publié: (2026)
Training-Free Exponential Context Extension via Cascading KV Cache
par: Willette, Jeffrey, et autres
Publié: (2024)
par: Willette, Jeffrey, et autres
Publié: (2024)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
par: Chen, Han, et autres
Publié: (2025)
par: Chen, Han, et autres
Publié: (2025)
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
par: Zuo, Fei, et autres
Publié: (2026)
par: Zuo, Fei, et autres
Publié: (2026)
PolarQuant: Quantizing KV Caches with Polar Transformation
par: Han, Insu, et autres
Publié: (2025)
par: Han, Insu, et autres
Publié: (2025)
ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition
par: Ye, Lu, et autres
Publié: (2024)
par: Ye, Lu, et autres
Publié: (2024)
ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals
par: Saxena, Utkarsh, et autres
Publié: (2024)
par: Saxena, Utkarsh, et autres
Publié: (2024)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More
par: Yue, Yuxuan, et autres
Publié: (2024)
par: Yue, Yuxuan, et autres
Publié: (2024)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
par: Taneja, Maanas, et autres
Publié: (2026)
par: Taneja, Maanas, et autres
Publié: (2026)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
par: Xu, Zukang, et autres
Publié: (2025)
par: Xu, Zukang, et autres
Publié: (2025)
Inference-Time Hyper-Scaling with KV Cache Compression
par: Łańcucki, Adrian, et autres
Publié: (2025)
par: Łańcucki, Adrian, et autres
Publié: (2025)
Sparse Attention across Multiple-context KV Cache
par: Cao, Ziyi, et autres
Publié: (2025)
par: Cao, Ziyi, et autres
Publié: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
par: Chang, Chi-Chih, et autres
Publié: (2025)
par: Chang, Chi-Chih, et autres
Publié: (2025)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization
par: Williams, Jorge L. Ruiz
Publié: (2026)
par: Williams, Jorge L. Ruiz
Publié: (2026)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
par: Qi, Yanlin, et autres
Publié: (2026)
par: Qi, Yanlin, et autres
Publié: (2026)
Documents similaires
-
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
par: Tayaranian, Mohammadreza, et autres
Publié: (2024) -
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024) -
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024) -
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
par: Jeon, Hyesung, et autres
Publié: (2024) -
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)