DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Jinyu, Zhang, Zhihan, Xie, Jiehui, Iqbal, Md. Tamim, Han, Dongshen, Lee, Lik-Hang, Bae, Sung-Ho, Zou, Jie, Yang, Yang, Zhang, Chaoning |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025)
por: Behnam, Payman, et al.
Publicado: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
por: Nadali, Alireza, et al.
Publicado: (2026)
por: Nadali, Alireza, et al.
Publicado: (2026)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026)
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors
por: Zhou, Yitian, et al.
Publicado: (2026)
por: Zhou, Yitian, et al.
Publicado: (2026)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
por: Li, Kunxi, et al.
Publicado: (2025)
por: Li, Kunxi, et al.
Publicado: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
por: Gokhale, Sai, et al.
Publicado: (2025)
por: Gokhale, Sai, et al.
Publicado: (2025)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
por: Zhang, Huawei, et al.
Publicado: (2025)
por: Zhang, Huawei, et al.
Publicado: (2025)
Adaptive KV Cache Reuse for Fast Long-Context LLM Serving
por: li, Fei, et al.
Publicado: (2026)
por: li, Fei, et al.
Publicado: (2026)
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
por: Yao, Dingyu, et al.
Publicado: (2025)
por: Yao, Dingyu, et al.
Publicado: (2025)
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2025)
por: Wan, Zhongwei, et al.
Publicado: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
por: Zhou, Xiabin, et al.
Publicado: (2024)
por: Zhou, Xiabin, et al.
Publicado: (2024)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
por: Mai, Tho, et al.
Publicado: (2026)
por: Mai, Tho, et al.
Publicado: (2026)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
por: Chen, Hong, et al.
Publicado: (2026)
por: Chen, Hong, et al.
Publicado: (2026)
ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
por: Zou, Jing, et al.
Publicado: (2026)
por: Zou, Jing, et al.
Publicado: (2026)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
por: Jo, Dongwon, et al.
Publicado: (2025)
por: Jo, Dongwon, et al.
Publicado: (2025)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
por: Chen, Chuangtao, et al.
Publicado: (2026)
por: Chen, Chuangtao, et al.
Publicado: (2026)
Competitive Non-Clairvoyant KV-Cache Scheduling for LLM Inference
por: Feng, Yiding, et al.
Publicado: (2026)
por: Feng, Yiding, et al.
Publicado: (2026)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
por: Qi, Yanlin, et al.
Publicado: (2026)
por: Qi, Yanlin, et al.
Publicado: (2026)
PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference
por: Patel, Ishan, et al.
Publicado: (2026)
por: Patel, Ishan, et al.
Publicado: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
por: Ma, Da, et al.
Publicado: (2024)
por: Ma, Da, et al.
Publicado: (2024)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
por: Li, Yucheng, et al.
Publicado: (2024)
por: Li, Yucheng, et al.
Publicado: (2024)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
por: Li, Weizhuo, et al.
Publicado: (2024)
por: Li, Weizhuo, et al.
Publicado: (2024)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
por: Yang, Bin, et al.
Publicado: (2025)
por: Yang, Bin, et al.
Publicado: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025)
por: Yu, Bohan, et al.
Publicado: (2025)
IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference
por: Yang, Xintong, et al.
Publicado: (2026)
por: Yang, Xintong, et al.
Publicado: (2026)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
por: Zhu, Yuxuan, et al.
Publicado: (2025)
por: Zhu, Yuxuan, et al.
Publicado: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
por: Wu, Wenbo, et al.
Publicado: (2025)
por: Wu, Wenbo, et al.
Publicado: (2025)
KV Cache Compression for Inference Efficiency in LLMs: A Review
por: Liu, Yanyu, et al.
Publicado: (2025)
por: Liu, Yanyu, et al.
Publicado: (2025)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
por: Zhao, Bingzhe, et al.
Publicado: (2025)
por: Zhao, Bingzhe, et al.
Publicado: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
por: Tian, Yuxuan, et al.
Publicado: (2025)
por: Tian, Yuxuan, et al.
Publicado: (2025)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
por: Liu, Guangda, et al.
Publicado: (2025)
por: Liu, Guangda, et al.
Publicado: (2025)
DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity
por: Hao, Jitai, et al.
Publicado: (2026)
por: Hao, Jitai, et al.
Publicado: (2026)
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
Ejemplares similares
-
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
por: Behnam, Payman, et al.
Publicado: (2025) -
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
por: Nadali, Alireza, et al.
Publicado: (2026) -
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
por: Sun, Hanshi, et al.
Publicado: (2024) -
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
por: Dehghanighobadi, Zahra, et al.
Publicado: (2026) -
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
por: Li, Yu, et al.
Publicado: (2026)