Sparse Prefix Caching for Hybrid and Recurrent LLM Serving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shirokikh, Mikhail, Nikolenko, Sergey |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
par: Xiang, Xingyu, et autres
Publié: (2025)
par: Xiang, Xingyu, et autres
Publié: (2025)
Marconi: Prefix Caching for the Era of Hybrid LLMs
par: Pan, Rui, et autres
Publié: (2024)
par: Pan, Rui, et autres
Publié: (2024)
Joint Encoding of KV-Cache Blocks for Scalable LLM Serving
par: Kampeas, Joseph, et autres
Publié: (2026)
par: Kampeas, Joseph, et autres
Publié: (2026)
POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving
par: Li, Shaoang, et autres
Publié: (2026)
par: Li, Shaoang, et autres
Publié: (2026)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
par: Feng, Shaoting, et autres
Publié: (2025)
par: Feng, Shaoting, et autres
Publié: (2025)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
par: Chen, Kaiwen, et autres
Publié: (2025)
par: Chen, Kaiwen, et autres
Publié: (2025)
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
MTServe: Efficient Serving for Generative Recommendation Models with Hierarchical Caches
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
Progressive Sparse Attention: Algorithm and System Co-design for Efficient Attention in LLM Serving
par: Zhou, Qihui, et autres
Publié: (2025)
par: Zhou, Qihui, et autres
Publié: (2025)
Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving
par: Ma, Bole, et autres
Publié: (2026)
par: Ma, Bole, et autres
Publié: (2026)
Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
par: Liu, Zikang, et autres
Publié: (2025)
par: Liu, Zikang, et autres
Publié: (2025)
DroidSpeak: KV Cache Sharing for Cross-LLM Communication and Multi-LLM Serving
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
par: Gao, Wei, et autres
Publié: (2025)
par: Gao, Wei, et autres
Publié: (2025)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
par: Geng, Yingsheng, et autres
Publié: (2026)
par: Geng, Yingsheng, et autres
Publié: (2026)
AdaptCache: KV Cache Native Storage Hierarchy for Low-Delay and High-Quality Language Model Serving
par: Feng, Shaoting, et autres
Publié: (2025)
par: Feng, Shaoting, et autres
Publié: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
OrbitFlow: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
par: Ma, Xinyue, et autres
Publié: (2026)
par: Ma, Xinyue, et autres
Publié: (2026)
Beyond Isolated Clients: Integrating Graph-Based Embeddings into Event Sequence Models
par: Proshian, Harry, et autres
Publié: (2026)
par: Proshian, Harry, et autres
Publié: (2026)
PrefixGPT: Prefix Adder Optimization by a Generative Pre-trained Transformer
par: Ding, Ruogu, et autres
Publié: (2025)
par: Ding, Ruogu, et autres
Publié: (2025)
Fast and Effective On-policy Distillation from Reasoning Prefixes
par: Zhang, Dongxu, et autres
Publié: (2026)
par: Zhang, Dongxu, et autres
Publié: (2026)
Bias-Restrained Prefix Representation Finetuning for Mathematical Reasoning
par: Liang, Sirui, et autres
Publié: (2025)
par: Liang, Sirui, et autres
Publié: (2025)
Parrot: Efficient Serving of LLM-based Applications with Semantic Variable
par: Lin, Chaofan, et autres
Publié: (2024)
par: Lin, Chaofan, et autres
Publié: (2024)
Efficient Multi-Adapter LLM Serving via Cross-Model KV-Cache Reuse with Activated LoRA
par: Li, Allison, et autres
Publié: (2025)
par: Li, Allison, et autres
Publié: (2025)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
par: Dong, Yanhao, et autres
Publié: (2025)
par: Dong, Yanhao, et autres
Publié: (2025)
dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
par: Liu, Zhiyuan, et autres
Publié: (2025)
par: Liu, Zhiyuan, et autres
Publié: (2025)
A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization
par: Lei, Shiye, et autres
Publié: (2026)
par: Lei, Shiye, et autres
Publié: (2026)
NeuralPrefix: A Zero-shot Sensory Data Imputation Plugin
par: Khamis, Abdelwahed, et autres
Publié: (2025)
par: Khamis, Abdelwahed, et autres
Publié: (2025)
Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs
par: Athiwaratkun, Ben, et autres
Publié: (2024)
par: Athiwaratkun, Ben, et autres
Publié: (2024)
Analytical Provisioning for Attention-FFN Disaggregated LLM Serving under Stochastic Workloads
par: Song, Chendong, et autres
Publié: (2026)
par: Song, Chendong, et autres
Publié: (2026)
ATP: Enabling Fast LLM Serving via Attention on Top Principal Keys
par: Niu, Yue, et autres
Publié: (2024)
par: Niu, Yue, et autres
Publié: (2024)
Category-Aware Semantic Caching for Heterogeneous LLM Workloads
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Neural Click Models for Recommender Systems
par: Shirokikh, Mikhail, et autres
Publié: (2024)
par: Shirokikh, Mikhail, et autres
Publié: (2024)
Towards Infinite-Long Prefix in Transformer
par: Liang, Yingyu, et autres
Publié: (2024)
par: Liang, Yingyu, et autres
Publié: (2024)
Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation
par: Yan, Hua, et autres
Publié: (2026)
par: Yan, Hua, et autres
Publié: (2026)
Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training
par: Wang, Xi, et autres
Publié: (2026)
par: Wang, Xi, et autres
Publié: (2026)
TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
par: Yüzügüler, Ahmet Caner, et autres
Publié: (2025)
par: Yüzügüler, Ahmet Caner, et autres
Publié: (2025)
SUN: Shared Use of Next-token Prediction for Efficient Multi-LLM Disaggregated Serving
par: Woo, Sunghyeon, et autres
Publié: (2026)
par: Woo, Sunghyeon, et autres
Publié: (2026)
Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack
par: Naik, Prathamesh Vasudeo, et autres
Publié: (2026)
par: Naik, Prathamesh Vasudeo, et autres
Publié: (2026)
CacheFormer: High Attention-Based Segment Caching
par: Singh, Sushant, et autres
Publié: (2025)
par: Singh, Sushant, et autres
Publié: (2025)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
par: Yang, Shang, et autres
Publié: (2025)
par: Yang, Shang, et autres
Publié: (2025)
Documents similaires
-
ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
par: Xiang, Xingyu, et autres
Publié: (2025) -
Marconi: Prefix Caching for the Era of Hybrid LLMs
par: Pan, Rui, et autres
Publié: (2024) -
Joint Encoding of KV-Cache Blocks for Scalable LLM Serving
par: Kampeas, Joseph, et autres
Publié: (2026) -
POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving
par: Li, Shaoang, et autres
Publié: (2026) -
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
par: Feng, Shaoting, et autres
Publié: (2025)