GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xuelin, Jin, Xiangqi, Zhang, Linfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025)
par: Liao, Mengqi, et autres
Publié: (2025)
CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
Taming the Fragility of KV Cache Eviction in LLM Inference
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences
par: Qin, Ziran, et autres
Publié: (2025)
par: Qin, Ziran, et autres
Publié: (2025)
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)
par: Gu, Yifeng, et autres
Publié: (2025)
RetentiveKV: State-Space Memory for Uncertainty-Aware Multimodal KV Cache Eviction
par: Liu, Sihao, et autres
Publié: (2026)
par: Liu, Sihao, et autres
Publié: (2026)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
par: Dong, Zican, et autres
Publié: (2026)
par: Dong, Zican, et autres
Publié: (2026)
In-context KV-Cache Eviction for LLMs via Attention-Gate
par: Zeng, Zihao, et autres
Publié: (2024)
par: Zeng, Zihao, et autres
Publié: (2024)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
par: Feng, Yuan, et autres
Publié: (2024)
par: Feng, Yuan, et autres
Publié: (2024)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
par: Li, Kunxi, et autres
Publié: (2025)
par: Li, Kunxi, et autres
Publié: (2025)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
par: An, Yongqi, et autres
Publié: (2026)
par: An, Yongqi, et autres
Publié: (2026)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026)
par: Mai, Tho, et autres
Publié: (2026)
SABlock: Semantic-Aware KV Cache Eviction with Adaptive Compression Block Size
par: Chen, Jinhan, et autres
Publié: (2025)
par: Chen, Jinhan, et autres
Publié: (2025)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
par: Chen, Yilong, et autres
Publié: (2024)
par: Chen, Yilong, et autres
Publié: (2024)
LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction
par: Zhou, Enshuai, et autres
Publié: (2026)
par: Zhou, Enshuai, et autres
Publié: (2026)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
par: Yang, Xintong, et autres
Publié: (2026)
par: Yang, Xintong, et autres
Publié: (2026)
LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
par: Zhang, Haoyue, et autres
Publié: (2025)
par: Zhang, Haoyue, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference
par: Zuo, Youhui, et autres
Publié: (2025)
par: Zuo, Youhui, et autres
Publié: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving
par: Zhong, Zhiqing, et autres
Publié: (2026)
par: Zhong, Zhiqing, et autres
Publié: (2026)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
KVSculpt: KV Cache Compression as Distillation
par: Jiang, Bo, et autres
Publié: (2026)
par: Jiang, Bo, et autres
Publié: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
par: Zhou, Yuhao, et autres
Publié: (2025)
par: Zhou, Yuhao, et autres
Publié: (2025)
KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding
par: Shi, Luohe, et autres
Publié: (2025)
par: Shi, Luohe, et autres
Publié: (2025)
CaliDrop: KV Cache Compression with Calibration
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
par: Cai, Zefan, et autres
Publié: (2024)
par: Cai, Zefan, et autres
Publié: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
par: Chen, Hong, et autres
Publié: (2026)
par: Chen, Hong, et autres
Publié: (2026)
RefreshKV: Updating Small KV Cache During Long-form Generation
par: Xu, Fangyuan, et autres
Publié: (2024)
par: Xu, Fangyuan, et autres
Publié: (2024)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
dKV-Cache: The Cache for Diffusion Language Models
par: Ma, Xinyin, et autres
Publié: (2025)
par: Ma, Xinyin, et autres
Publié: (2025)
Documents similaires
-
G-KV: Decoding-Time KV Cache Eviction with Global Attention
par: Liao, Mengqi, et autres
Publié: (2025) -
CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective
par: Feng, Yuan, et autres
Publié: (2025) -
Taming the Fragility of KV Cache Eviction in LLM Inference
par: Feng, Yuan, et autres
Publié: (2025) -
CAKE: Cascading and Adaptive KV Cache Eviction with Layer Preferences
par: Qin, Ziran, et autres
Publié: (2025) -
AhaKV: Adaptive Holistic Attention-Driven KV Cache Eviction for Efficient Inference of Large Language Models
par: Gu, Yifeng, et autres
Publié: (2025)