TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dzikanyanga, Gradwell, Yang, Weihao, Huang, Hao, Wu, Donglei, Wang, Shihao, Xia, Wen, C, Sanjeeb K |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026)
par: Mai, Tho, et autres
Publié: (2026)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
par: Yang, Xintong, et autres
Publié: (2026)
par: Yang, Xintong, et autres
Publié: (2026)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference
par: Lin, Jian, et autres
Publié: (2026)
par: Lin, Jian, et autres
Publié: (2026)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
par: Li, Kunxi, et autres
Publié: (2025)
par: Li, Kunxi, et autres
Publié: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026)
par: Nadali, Alireza, et autres
Publié: (2026)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
par: Guo, Jinyu, et autres
Publié: (2026)
par: Guo, Jinyu, et autres
Publié: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
par: Hao, Jitai, et autres
Publié: (2026)
par: Hao, Jitai, et autres
Publié: (2026)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
Efficient Long-Context LLM Inference via KV Cache Clustering
par: Hu, Jie, et autres
Publié: (2025)
par: Hu, Jie, et autres
Publié: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference
par: Feng, Yuan, et autres
Publié: (2024)
par: Feng, Yuan, et autres
Publié: (2024)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
KV Cache Transform Coding for Compact Storage in LLM Inference
par: Staniszewski, Konrad, et autres
Publié: (2025)
par: Staniszewski, Konrad, et autres
Publié: (2025)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)
par: Li, Weizhuo, et autres
Publié: (2024)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
BUZZ: Beehive-structured Sparse KV Cache with Segmented Heavy Hitters for Efficient LLM Inference
par: Zhao, Junqi, et autres
Publié: (2024)
par: Zhao, Junqi, et autres
Publié: (2024)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
par: Wu, Wei, et autres
Publié: (2024)
par: Wu, Wei, et autres
Publié: (2024)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
par: Monteiro, João, et autres
Publié: (2024)
par: Monteiro, João, et autres
Publié: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
par: Shi, Dachuan, et autres
Publié: (2025)
par: Shi, Dachuan, et autres
Publié: (2025)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
par: Wang, Luning, et autres
Publié: (2024)
par: Wang, Luning, et autres
Publié: (2024)
Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
par: Luo, Zhifan, et autres
Publié: (2025)
par: Luo, Zhifan, et autres
Publié: (2025)
KV Cache Offloading for Context-Intensive Tasks
par: Bocharnikov, Andrey, et autres
Publié: (2026)
par: Bocharnikov, Andrey, et autres
Publié: (2026)
Lossless KV Cache Compression to 2%
par: Yang, Zhen, et autres
Publié: (2024)
par: Yang, Zhen, et autres
Publié: (2024)
BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache
par: Du, Dayou, et autres
Publié: (2025)
par: Du, Dayou, et autres
Publié: (2025)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
par: Cai, Zefan, et autres
Publié: (2025)
par: Cai, Zefan, et autres
Publié: (2025)
KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
par: Zhang, Huawei, et autres
Publié: (2025)
par: Zhang, Huawei, et autres
Publié: (2025)
KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse
par: Yang, Huan, et autres
Publié: (2025)
par: Yang, Huan, et autres
Publié: (2025)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
par: Yao, Dingyu, et autres
Publié: (2025)
par: Yao, Dingyu, et autres
Publié: (2025)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
par: Li, Weiqing, et autres
Publié: (2025)
par: Li, Weiqing, et autres
Publié: (2025)
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
par: Wan, Zhongwei, et autres
Publié: (2025)
par: Wan, Zhongwei, et autres
Publié: (2025)
Documents similaires
-
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026) -
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026) -
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
par: Yang, Xintong, et autres
Publié: (2026) -
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025) -
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)