CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | Feng, Yuan, Lv, Junlin, Guo, Haoyu, Cao, Yukun, Zhou, S Kevin, Xie, Xike |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
di: Feng, Yuan, et al.
Pubblicazione: (2024)
di: Feng, Yuan, et al.
Pubblicazione: (2024)
Taming the Fragility of KV Cache Eviction in LLM Inference
di: Feng, Yuan, et al.
Pubblicazione: (2025)
di: Feng, Yuan, et al.
Pubblicazione: (2025)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
di: An, Yongqi, et al.
Pubblicazione: (2026)
di: An, Yongqi, et al.
Pubblicazione: (2026)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
di: Liao, Mengqi, et al.
Pubblicazione: (2025)
di: Liao, Mengqi, et al.
Pubblicazione: (2025)
CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences
di: Qin, Ziran, et al.
Pubblicazione: (2025)
di: Qin, Ziran, et al.
Pubblicazione: (2025)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
di: Dong, Zican, et al.
Pubblicazione: (2026)
di: Dong, Zican, et al.
Pubblicazione: (2026)
GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
di: Li, Xuelin, et al.
Pubblicazione: (2025)
di: Li, Xuelin, et al.
Pubblicazione: (2025)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
di: Goel, Raghavv, et al.
Pubblicazione: (2025)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
di: Liu, Sihao, et al.
Pubblicazione: (2026)
di: Liu, Sihao, et al.
Pubblicazione: (2026)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
di: Gu, Yifeng, et al.
Pubblicazione: (2025)
di: Gu, Yifeng, et al.
Pubblicazione: (2025)
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
di: Liu, Yijun, et al.
Pubblicazione: (2025)
di: Liu, Yijun, et al.
Pubblicazione: (2025)
In-context KV-Cache Eviction for LLMs via Attention-Gate
di: Zeng, Zihao, et al.
Pubblicazione: (2024)
di: Zeng, Zihao, et al.
Pubblicazione: (2024)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
di: Mai, Tho, et al.
Pubblicazione: (2026)
di: Mai, Tho, et al.
Pubblicazione: (2026)
SABlock: Semantic-Aware KV Cache Eviction with Adaptive Compression Block Size
di: Chen, Jinhan, et al.
Pubblicazione: (2025)
di: Chen, Jinhan, et al.
Pubblicazione: (2025)
LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction
di: Zhou, Enshuai, et al.
Pubblicazione: (2026)
di: Zhou, Enshuai, et al.
Pubblicazione: (2026)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
di: Wang, Yixuan, et al.
Pubblicazione: (2025)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
di: Yang, Xintong, et al.
Pubblicazione: (2026)
di: Yang, Xintong, et al.
Pubblicazione: (2026)
LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
di: Zhang, Haoyue, et al.
Pubblicazione: (2025)
SkewRoute: Training-Free LLM Routing for Knowledge Graph Retrieval-Augmented Generation via Score Skewness of Retrieved Context
di: Wang, Hairu, et al.
Pubblicazione: (2025)
di: Wang, Hairu, et al.
Pubblicazione: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
di: Lv, Junlin, et al.
Pubblicazione: (2024)
di: Lv, Junlin, et al.
Pubblicazione: (2024)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
di: Guo, Jinyu, et al.
Pubblicazione: (2026)
Task-KV: Task-aware KV Cache Optimization via Semantic Differentiation of Attention Heads
di: He, Xingyang, et al.
Pubblicazione: (2025)
di: He, Xingyang, et al.
Pubblicazione: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
di: Yao, Dingyu, et al.
Pubblicazione: (2025)
di: Yao, Dingyu, et al.
Pubblicazione: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
di: Yu, Bohan, et al.
Pubblicazione: (2025)
di: Yu, Bohan, et al.
Pubblicazione: (2025)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
di: Ji, Shiyu, et al.
Pubblicazione: (2026)
di: Ji, Shiyu, et al.
Pubblicazione: (2026)
RefreshKV: Updating Small KV Cache During Long-form Generation
di: Xu, Fangyuan, et al.
Pubblicazione: (2024)
di: Xu, Fangyuan, et al.
Pubblicazione: (2024)
CaliDrop: KV Cache Compression with Calibration
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
dKV-Cache: The Cache for Diffusion Language Models
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
di: Ma, Xinyin, et al.
Pubblicazione: (2025)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2026)
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2026)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Sparse Attention across Multiple-context KV Cache
di: Cao, Ziyi, et al.
Pubblicazione: (2025)
di: Cao, Ziyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
di: Feng, Yuan, et al.
Pubblicazione: (2024) -
Taming the Fragility of KV Cache Eviction in LLM Inference
di: Feng, Yuan, et al.
Pubblicazione: (2025) -
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
di: An, Yongqi, et al.
Pubblicazione: (2026) -
G-KV: Decoding-Time KV Cache Eviction with Global Attention
di: Liao, Mengqi, et al.
Pubblicazione: (2025) -
CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences
di: Qin, Ziran, et al.
Pubblicazione: (2025)