Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Bui, Ngoc, Sharma, Shubham, Lamba, Simran, Mishra, Saumitra, Ying, Rex |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
di: Liu, Sihao, et al.
Pubblicazione: (2026)
di: Liu, Sihao, et al.
Pubblicazione: (2026)
Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction
di: Bui, Ngoc, et al.
Pubblicazione: (2026)
di: Bui, Ngoc, et al.
Pubblicazione: (2026)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
di: He, Yefei, et al.
Pubblicazione: (2024)
di: He, Yefei, et al.
Pubblicazione: (2024)
Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
di: Liu, Andy Zeyi, et al.
Pubblicazione: (2026)
di: Liu, Andy Zeyi, et al.
Pubblicazione: (2026)
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
di: Yang, Bin, et al.
Pubblicazione: (2025)
di: Yang, Bin, et al.
Pubblicazione: (2025)
The Pitfalls of KV Cache Compression
di: Chen, Alex, et al.
Pubblicazione: (2025)
di: Chen, Alex, et al.
Pubblicazione: (2025)
Beyond KV Caching: Shared Attention for Efficient LLMs
di: Liao, Bingli, et al.
Pubblicazione: (2024)
di: Liao, Bingli, et al.
Pubblicazione: (2024)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
di: Geng, Yingsheng, et al.
Pubblicazione: (2026)
di: Geng, Yingsheng, et al.
Pubblicazione: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
di: Chen, Kaiwen, et al.
Pubblicazione: (2025)
Attention Is All You Need for KV Cache in Diffusion LLMs
di: Nguyen-Tri, Quan, et al.
Pubblicazione: (2025)
di: Nguyen-Tri, Quan, et al.
Pubblicazione: (2025)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
CoKV: Optimizing KV Cache Allocation via Cooperative Game
di: Sun, Qiheng, et al.
Pubblicazione: (2025)
di: Sun, Qiheng, et al.
Pubblicazione: (2025)
ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection
di: Datta, Debajyoti, et al.
Pubblicazione: (2026)
di: Datta, Debajyoti, et al.
Pubblicazione: (2026)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
di: Wu, Wei, et al.
Pubblicazione: (2024)
di: Wu, Wei, et al.
Pubblicazione: (2024)
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
PolarQuant: Quantizing KV Caches with Polar Transformation
di: Han, Insu, et al.
Pubblicazione: (2025)
di: Han, Insu, et al.
Pubblicazione: (2025)
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
di: Swain, Kabir, et al.
Pubblicazione: (2026)
di: Swain, Kabir, et al.
Pubblicazione: (2026)
Palu: Compressing KV-Cache with Low-Rank Projection
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization
di: Yang, June Yong, et al.
Pubblicazione: (2024)
di: Yang, June Yong, et al.
Pubblicazione: (2024)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
di: Lu, Liming, et al.
Pubblicazione: (2026)
di: Lu, Liming, et al.
Pubblicazione: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
Memory Caching: RNNs with Growing Memory
di: Behrouz, Ali, et al.
Pubblicazione: (2026)
di: Behrouz, Ali, et al.
Pubblicazione: (2026)
Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs
di: Ghadia, Ravi, et al.
Pubblicazione: (2025)
di: Ghadia, Ravi, et al.
Pubblicazione: (2025)
HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
di: Yang, Dongquan, et al.
Pubblicazione: (2025)
KV Cache Offloading for Context-Intensive Tasks
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
Joint Encoding of KV-Cache Blocks for Scalable LLM Serving
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
di: Kampeas, Joseph, et al.
Pubblicazione: (2026)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
di: Liu, Guangda, et al.
Pubblicazione: (2024)
di: Liu, Guangda, et al.
Pubblicazione: (2024)
LagKV: Lag-Relative Information of the KV Cache Tells Which Tokens Are Important
di: Liang, Manlai, et al.
Pubblicazione: (2025)
di: Liang, Manlai, et al.
Pubblicazione: (2025)
How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
di: Zhu, Rui, et al.
Pubblicazione: (2026)
di: Zhu, Rui, et al.
Pubblicazione: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers
di: Wang, Xiao
Pubblicazione: (2026)
di: Wang, Xiao
Pubblicazione: (2026)
ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
di: Xiang, Xingyu, et al.
Pubblicazione: (2025)
di: Xiang, Xingyu, et al.
Pubblicazione: (2025)
Stateful KV Cache Management for LLMs: Balancing Space, Time, Accuracy, and Positional Fidelity
di: Poudel, Pratik
Pubblicazione: (2025)
di: Poudel, Pratik
Pubblicazione: (2025)
Documenti analoghi
-
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
di: Liu, Sihao, et al.
Pubblicazione: (2026) -
Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction
di: Bui, Ngoc, et al.
Pubblicazione: (2026) -
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
di: He, Yefei, et al.
Pubblicazione: (2024) -
Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs
di: Liu, Andy Zeyi, et al.
Pubblicazione: (2026) -
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)