Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Harry, Yang, Xinyu, Zhang, Zhenyu, Wang, Zhangyang, Chi, Yuejie, Chen, Beidi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
par: Feng, Shaoting, et autres
Publié: (2025)
par: Feng, Shaoting, et autres
Publié: (2025)
The Pitfalls of KV Cache Compression
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024)
par: Liu, Guangda, et autres
Publié: (2024)
Palu: Compressing KV-Cache with Low-Rank Projection
par: Chang, Chi-Chih, et autres
Publié: (2024)
par: Chang, Chi-Chih, et autres
Publié: (2024)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
par: Dong, Yanhao, et autres
Publié: (2025)
par: Dong, Yanhao, et autres
Publié: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026)
par: Nadali, Alireza, et autres
Publié: (2026)
Online Scheduling for LLM Inference with KV Cache Constraints
par: Jaillet, Patrick, et autres
Publié: (2025)
par: Jaillet, Patrick, et autres
Publié: (2025)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
par: Zeng, Bowen, et autres
Publié: (2026)
par: Zeng, Bowen, et autres
Publié: (2026)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
KV Cache Transform Coding for Compact Storage in LLM Inference
par: Staniszewski, Konrad, et autres
Publié: (2025)
par: Staniszewski, Konrad, et autres
Publié: (2025)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
par: Swain, Kabir, et autres
Publié: (2026)
par: Swain, Kabir, et autres
Publié: (2026)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
par: Li, Kunxi, et autres
Publié: (2025)
par: Li, Kunxi, et autres
Publié: (2025)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
par: Zhang, Te, et autres
Publié: (2025)
par: Zhang, Te, et autres
Publié: (2025)
APE: Faster and Longer Context-Augmented Generation via Adaptive Parallel Encoding
par: Yang, Xinyu, et autres
Publié: (2025)
par: Yang, Xinyu, et autres
Publié: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
par: Wu, Wenbo, et autres
Publié: (2025)
par: Wu, Wenbo, et autres
Publié: (2025)
How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
par: Zhu, Rui, et autres
Publié: (2026)
par: Zhu, Rui, et autres
Publié: (2026)
Make Your LVLM KV Cache More Lightweight
par: Chen, Xihao, et autres
Publié: (2026)
par: Chen, Xihao, et autres
Publié: (2026)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
KV Cache Optimization Strategies for Scalable and Efficient LLM Inference
par: Xu, Yichun, et autres
Publié: (2026)
par: Xu, Yichun, et autres
Publié: (2026)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
par: Geng, Yingsheng, et autres
Publié: (2026)
par: Geng, Yingsheng, et autres
Publié: (2026)
Quantization Dominates Rank Reduction for KV-Cache Compression
par: Salfati, Samuel
Publié: (2026)
par: Salfati, Samuel
Publié: (2026)
The Residual Stream Is All You Need: On the Redundancy of the KV Cache in Transformer Inference
par: Qasim, Kaleem Ullah, et autres
Publié: (2026)
par: Qasim, Kaleem Ullah, et autres
Publié: (2026)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
par: Liu, Akide, et autres
Publié: (2024)
par: Liu, Akide, et autres
Publié: (2024)
RAP: KV-Cache Compression via RoPE-Aligned Pruning
par: Xin, Jihao, et autres
Publié: (2026)
par: Xin, Jihao, et autres
Publié: (2026)
S$^{2}$FT: Efficient, Scalable and Generalizable LLM Fine-tuning by Structured Sparsity
par: Yang, Xinyu, et autres
Publié: (2024)
par: Yang, Xinyu, et autres
Publié: (2024)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
par: Chen, Chuangtao, et autres
Publié: (2026)
par: Chen, Chuangtao, et autres
Publié: (2026)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
par: Datta, Debajyoti, et autres
Publié: (2026)
par: Datta, Debajyoti, et autres
Publié: (2026)
Documents similaires
-
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024) -
Scalable LLM Reasoning Acceleration with Low-rank Distillation
par: Dong, Harry, et autres
Publié: (2025) -
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025) -
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025) -
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
par: Zhao, Yi, et autres
Publié: (2025)