FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management
Fuente:
arXiv
Guardado en:
| Autores principales: | Takbir, Nazmul, Alikhani, Hamidreza, Dutt, Nikil, Jyothi, Sangeetha Abdu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
por: Tang, Hanlin, et al.
Publicado: (2024)
por: Tang, Hanlin, et al.
Publicado: (2024)
LBI: Parallel Scan Backpropagation via Latent Bounded Interfaces
por: Lee, Shaun Christopher, et al.
Publicado: (2026)
por: Lee, Shaun Christopher, et al.
Publicado: (2026)
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
por: Yang, Qingyue, et al.
Publicado: (2025)
por: Yang, Qingyue, et al.
Publicado: (2025)
Beyond KV Caching: Shared Attention for Efficient LLMs
por: Liao, Bingli, et al.
Publicado: (2024)
por: Liao, Bingli, et al.
Publicado: (2024)
CrystalBox: Future-Based Explanations for Input-Driven Deep RL Systems
por: Patel, Sagar, et al.
Publicado: (2023)
por: Patel, Sagar, et al.
Publicado: (2023)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
Sparse Attention across Multiple-context KV Cache
por: Cao, Ziyi, et al.
Publicado: (2025)
por: Cao, Ziyi, et al.
Publicado: (2025)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
por: Zheng, Haoyu, et al.
Publicado: (2026)
por: Zheng, Haoyu, et al.
Publicado: (2026)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
por: Song, Yurun, et al.
Publicado: (2025)
por: Song, Yurun, et al.
Publicado: (2025)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
por: Ramachandran, Akshat, et al.
Publicado: (2025)
por: Ramachandran, Akshat, et al.
Publicado: (2025)
ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition
por: Ye, Lu, et al.
Publicado: (2024)
por: Ye, Lu, et al.
Publicado: (2024)
KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity
por: Lesens, Damien, et al.
Publicado: (2025)
por: Lesens, Damien, et al.
Publicado: (2025)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
por: Yang, Bin, et al.
Publicado: (2025)
por: Yang, Bin, et al.
Publicado: (2025)
In-context KV-Cache Eviction for LLMs via Attention-Gate
por: Zeng, Zihao, et al.
Publicado: (2024)
por: Zeng, Zihao, et al.
Publicado: (2024)
Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache
por: Dehghankar, Mohsen, et al.
Publicado: (2026)
por: Dehghankar, Mohsen, et al.
Publicado: (2026)
The Pitfalls of KV Cache Compression
por: Chen, Alex, et al.
Publicado: (2025)
por: Chen, Alex, et al.
Publicado: (2025)
Training Transformers for KV Cache Compressibility
por: Gelberg, Yoav, et al.
Publicado: (2026)
por: Gelberg, Yoav, et al.
Publicado: (2026)
KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
por: Akulov, Dmitry, et al.
Publicado: (2025)
por: Akulov, Dmitry, et al.
Publicado: (2025)
Eigen Attention: Attention in Low-Rank Space for KV Cache Compression
por: Saxena, Utkarsh, et al.
Publicado: (2024)
por: Saxena, Utkarsh, et al.
Publicado: (2024)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
por: Yan, Xianglong, et al.
Publicado: (2025)
por: Yan, Xianglong, et al.
Publicado: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
por: Wu, Wenbo, et al.
Publicado: (2025)
por: Wu, Wenbo, et al.
Publicado: (2025)
Leveraging Traceroute Inconsistencies to Improve IP Geolocation
por: Ramanathan, Alagappan, et al.
Publicado: (2025)
por: Ramanathan, Alagappan, et al.
Publicado: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
por: Liu, Guangda, et al.
Publicado: (2025)
por: Liu, Guangda, et al.
Publicado: (2025)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
por: Yao, Jiayi, et al.
Publicado: (2026)
por: Yao, Jiayi, et al.
Publicado: (2026)
Attention Is All You Need for KV Cache in Diffusion LLMs
por: Nguyen-Tri, Quan, et al.
Publicado: (2025)
por: Nguyen-Tri, Quan, et al.
Publicado: (2025)
Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle
por: Wang, Zihan, et al.
Publicado: (2026)
por: Wang, Zihan, et al.
Publicado: (2026)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
por: Liu, Yuhan, et al.
Publicado: (2025)
por: Liu, Yuhan, et al.
Publicado: (2025)
Compute Or Load KV Cache? Why Not Both?
por: Jin, Shuowei, et al.
Publicado: (2024)
por: Jin, Shuowei, et al.
Publicado: (2024)
LongFlow: Efficient KV Cache Compression for Reasoning Models
por: Su, Yi, et al.
Publicado: (2026)
por: Su, Yi, et al.
Publicado: (2026)
Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
por: Bui, Ngoc, et al.
Publicado: (2025)
por: Bui, Ngoc, et al.
Publicado: (2025)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
por: Geng, Yingsheng, et al.
Publicado: (2026)
por: Geng, Yingsheng, et al.
Publicado: (2026)
HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization
por: Williams, Jorge L. Ruiz
Publicado: (2026)
por: Williams, Jorge L. Ruiz
Publicado: (2026)
ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference
por: Zhang, Qiuyang, et al.
Publicado: (2026)
por: Zhang, Qiuyang, et al.
Publicado: (2026)
Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models
por: Ma, Xindian, et al.
Publicado: (2026)
por: Ma, Xindian, et al.
Publicado: (2026)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
por: Chen, Kaiwen, et al.
Publicado: (2025)
por: Chen, Kaiwen, et al.
Publicado: (2025)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
por: Li, Kunjun, et al.
Publicado: (2025)
por: Li, Kunjun, et al.
Publicado: (2025)
LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents
por: Jeon, Hyesung, et al.
Publicado: (2026)
por: Jeon, Hyesung, et al.
Publicado: (2026)
KVSculpt: KV Cache Compression as Distillation
por: Jiang, Bo, et al.
Publicado: (2026)
por: Jiang, Bo, et al.
Publicado: (2026)
Ejemplares similares
-
RazorAttention: Efficient KV Cache Compression Through Retrieval Heads
por: Tang, Hanlin, et al.
Publicado: (2024) -
LBI: Parallel Scan Backpropagation via Latent Bounded Interfaces
por: Lee, Shaun Christopher, et al.
Publicado: (2026) -
AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
por: Yang, Qingyue, et al.
Publicado: (2025) -
Beyond KV Caching: Shared Attention for Efficient LLMs
por: Liao, Bingli, et al.
Publicado: (2024) -
CrystalBox: Future-Based Explanations for Input-Driven Deep RL Systems
por: Patel, Sagar, et al.
Publicado: (2023)