MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yu, Li, Binxu, Lan, Tian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
di: Li, Yubo, et al.
Pubblicazione: (2026)
di: Li, Yubo, et al.
Pubblicazione: (2026)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
di: Dong, Zican, et al.
Pubblicazione: (2026)
di: Dong, Zican, et al.
Pubblicazione: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction
di: Bui, Ngoc, et al.
Pubblicazione: (2026)
di: Bui, Ngoc, et al.
Pubblicazione: (2026)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
di: Liu, Sihao, et al.
Pubblicazione: (2026)
di: Liu, Sihao, et al.
Pubblicazione: (2026)
KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
di: Gokhale, Sai, et al.
Pubblicazione: (2025)
di: Gokhale, Sai, et al.
Pubblicazione: (2025)
LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
di: Ahn, Jinwoo, et al.
Pubblicazione: (2026)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
di: Behnam, Payman, et al.
Pubblicazione: (2025)
di: Behnam, Payman, et al.
Pubblicazione: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
In-context KV-Cache Eviction for LLMs via Attention-Gate
di: Zeng, Zihao, et al.
Pubblicazione: (2024)
di: Zeng, Zihao, et al.
Pubblicazione: (2024)
A Simple Plug-in for Improving Eviction-Based KV Cache Compression
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
di: Zhang, Junkai, et al.
Pubblicazione: (2026)
di: Zhang, Junkai, et al.
Pubblicazione: (2026)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
di: Chen, Chuangtao, et al.
Pubblicazione: (2026)
Beyond Token Eviction: Mixed-Dimension Budget Allocation for Efficient KV Cache Compression
di: Miao, Ruijie, et al.
Pubblicazione: (2026)
di: Miao, Ruijie, et al.
Pubblicazione: (2026)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models
di: Ma, Xindian, et al.
Pubblicazione: (2026)
di: Ma, Xindian, et al.
Pubblicazione: (2026)
LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
di: Shen, Yiqun, et al.
Pubblicazione: (2025)
di: Shen, Yiqun, et al.
Pubblicazione: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
Leyline: KV Cache Directives for Agentic Inference
di: Ma, Bole, et al.
Pubblicazione: (2026)
di: Ma, Bole, et al.
Pubblicazione: (2026)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
di: Qi, Yanlin, et al.
Pubblicazione: (2026)
di: Qi, Yanlin, et al.
Pubblicazione: (2026)
LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
di: Li, Yucheng, et al.
Pubblicazione: (2024)
di: Li, Yucheng, et al.
Pubblicazione: (2024)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
di: Mai, Tho, et al.
Pubblicazione: (2026)
di: Mai, Tho, et al.
Pubblicazione: (2026)
Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective
di: Yang, Jiaming, et al.
Pubblicazione: (2026)
di: Yang, Jiaming, et al.
Pubblicazione: (2026)
Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2026)
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2026)
LongFlow: Efficient KV Cache Compression for Reasoning Models
di: Su, Yi, et al.
Pubblicazione: (2026)
di: Su, Yi, et al.
Pubblicazione: (2026)
When Does Value-Aware KV Eviction Help? A Fixed-Contract Diagnostic for Non-Monotone Cache Compression
di: Zhang, Ruijie, et al.
Pubblicazione: (2026)
di: Zhang, Ruijie, et al.
Pubblicazione: (2026)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
di: Wang, Luning, et al.
Pubblicazione: (2024)
di: Wang, Luning, et al.
Pubblicazione: (2024)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
di: Tian, Yuxuan, et al.
Pubblicazione: (2025)
SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
di: Wu, Wenbo, et al.
Pubblicazione: (2025)
MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache
di: Sharma, Akshat, et al.
Pubblicazione: (2024)
di: Sharma, Akshat, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025) -
CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
di: Li, Yubo, et al.
Pubblicazione: (2026) -
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
di: Dong, Zican, et al.
Pubblicazione: (2026) -
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
di: Wang, Guangtao, et al.
Pubblicazione: (2025) -
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
di: Sun, Hanshi, et al.
Pubblicazione: (2024)