QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yanshu, Li, Wang, Yao, Zhaoqian, Yang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
par: Wang, Yanshu, et autres
Publié: (2024)
par: Wang, Yanshu, et autres
Publié: (2024)
An experimental study of KV cache reuse strategies in chunk-level caching systems
par: Cestola, Samuel, et autres
Publié: (2026)
par: Cestola, Samuel, et autres
Publié: (2026)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
par: Tang, Hanlin, et autres
Publié: (2024)
par: Tang, Hanlin, et autres
Publié: (2024)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
par: Yang, Qingyue, et autres
Publié: (2025)
par: Yang, Qingyue, et autres
Publié: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization
par: Wang, YiFeng, et autres
Publié: (2026)
par: Wang, YiFeng, et autres
Publié: (2026)
Residual-Mass Accounting for Partial-KV Decoding
par: Hoshi, Yasuto, et autres
Publié: (2026)
par: Hoshi, Yasuto, et autres
Publié: (2026)
SALS: Sparse Attention in Latent Space for KV cache Compression
par: Mu, Junlin, et autres
Publié: (2025)
par: Mu, Junlin, et autres
Publié: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference
par: Ye, Jiancai, et autres
Publié: (2026)
par: Ye, Jiancai, et autres
Publié: (2026)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
par: Chang, Chi-Chih, et autres
Publié: (2025)
par: Chang, Chi-Chih, et autres
Publié: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression
par: Ji, Zhongping
Publié: (2026)
par: Ji, Zhongping
Publié: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
par: Patel, Ishan, et autres
Publié: (2026)
par: Patel, Ishan, et autres
Publié: (2026)
LongFlow: Efficient KV Cache Compression for Reasoning Models
par: Su, Yi, et autres
Publié: (2026)
par: Su, Yi, et autres
Publié: (2026)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)
par: Li, Weizhuo, et autres
Publié: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
Inference-Time Hyper-Scaling with KV Cache Compression
par: Łańcucki, Adrian, et autres
Publié: (2025)
par: Łańcucki, Adrian, et autres
Publié: (2025)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
par: Li, Jiaqian, et autres
Publié: (2026)
par: Li, Jiaqian, et autres
Publié: (2026)
MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache
par: Sharma, Akshat, et autres
Publié: (2024)
par: Sharma, Akshat, et autres
Publié: (2024)
MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection
par: Lin, Bokai, et autres
Publié: (2024)
par: Lin, Bokai, et autres
Publié: (2024)
iFairy: the First 2-bit Complex LLM with All Parameters in $\{\pm1, \pm i\}$
par: Wang, Feiyu, et autres
Publié: (2025)
par: Wang, Feiyu, et autres
Publié: (2025)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
Residual vector quantization for KV cache compression in large language model
par: Kumar, Ankur
Publié: (2024)
par: Kumar, Ankur
Publié: (2024)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals
par: Saxena, Utkarsh, et autres
Publié: (2024)
par: Saxena, Utkarsh, et autres
Publié: (2024)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
par: Shao, Yuantian, et autres
Publié: (2025)
par: Shao, Yuantian, et autres
Publié: (2025)
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
par: Vicentino, Caio
Publié: (2026)
par: Vicentino, Caio
Publié: (2026)
Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
par: Xiong, Boya, et autres
Publié: (2025)
par: Xiong, Boya, et autres
Publié: (2025)
ComPEFT: Compression for Communicating Parameter Efficient Updates via Sparsification and Quantization
par: Yadav, Prateek, et autres
Publié: (2023)
par: Yadav, Prateek, et autres
Publié: (2023)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
par: Zeng, Hanqing, et autres
Publié: (2025)
par: Zeng, Hanqing, et autres
Publié: (2025)
Documents similaires
-
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
par: Wang, Yanshu, et autres
Publié: (2024) -
An experimental study of KV cache reuse strategies in chunk-level caching systems
par: Cestola, Samuel, et autres
Publié: (2026) -
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025) -
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026) -
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)