XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Monteiro, João, Marcotte, Étienne, Noël, Pierre-André, Zantedeschi, Valentina, Vázquez, David, Chapados, Nicolas, Pal, Christopher, Taslakian, Perouz |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
TACTiS-2: Better, Faster, Simpler Attentional Copulas for Multivariate Time Series
par: Ashok, Arjun, et autres
Publié: (2023)
par: Ashok, Arjun, et autres
Publié: (2023)
Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs
par: Ashok, Arjun, et autres
Publié: (2025)
par: Ashok, Arjun, et autres
Publié: (2025)
InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation
par: Sahu, Gaurav, et autres
Publié: (2024)
par: Sahu, Gaurav, et autres
Publié: (2024)
Hierarchical Retrieval at Scale: Bridging Transparency and Efficiency
par: Gupta, Shubham, et autres
Publié: (2025)
par: Gupta, Shubham, et autres
Publié: (2025)
Learning to Defer for Causal Discovery with Imperfect Experts
par: Clivio, Oscar, et autres
Publié: (2025)
par: Clivio, Oscar, et autres
Publié: (2025)
Context is Key: A Benchmark for Forecasting with Essential Textual Information
par: Williams, Andrew Robert, et autres
Publié: (2024)
par: Williams, Andrew Robert, et autres
Publié: (2024)
BiXSE: Improving Dense Retrieval via Probabilistic Graded Relevance Distillation
par: Tsirigotis, Christos, et autres
Publié: (2025)
par: Tsirigotis, Christos, et autres
Publié: (2025)
Efficient Long-Context LLM Inference via KV Cache Clustering
par: Hu, Jie, et autres
Publié: (2025)
par: Hu, Jie, et autres
Publié: (2025)
Overcoming the Modality Gap in Context-Aided Forecasting
par: Zheng, Vincent Zhihao, et autres
Publié: (2026)
par: Zheng, Vincent Zhihao, et autres
Publié: (2026)
CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference
par: Wu, Guanlong, et autres
Publié: (2026)
par: Wu, Guanlong, et autres
Publié: (2026)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
par: Gu, Yuzhe, et autres
Publié: (2025)
par: Gu, Yuzhe, et autres
Publié: (2025)
Efficient LLM Inference with Activation Checkpointing and Hybrid Caching
par: Lee, Sanghyeon, et autres
Publié: (2025)
par: Lee, Sanghyeon, et autres
Publié: (2025)
Nectar: Neural Estimation of Cached-Token Attention via Regression
par: Monteiro, João, et autres
Publié: (2026)
par: Monteiro, João, et autres
Publié: (2026)
HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference
par: Shi, Zhiyuan, et autres
Publié: (2026)
par: Shi, Zhiyuan, et autres
Publié: (2026)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
par: Yao, Jiayi, et autres
Publié: (2026)
par: Yao, Jiayi, et autres
Publié: (2026)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
par: Mai, Tho, et autres
Publié: (2026)
par: Mai, Tho, et autres
Publié: (2026)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
par: Dzikanyanga, Gradwell, et autres
Publié: (2026)
ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
par: Liu, Xiang, et autres
Publié: (2025)
par: Liu, Xiang, et autres
Publié: (2025)
ToolCaching: Towards Efficient Caching for LLM Tool-calling
par: Zhai, Yi, et autres
Publié: (2026)
par: Zhai, Yi, et autres
Publié: (2026)
Tail-Optimized Caching for LLM Inference
par: Zhang, Wenxin, et autres
Publié: (2025)
par: Zhang, Wenxin, et autres
Publié: (2025)
KV Cache Optimization Strategies for Scalable and Efficient LLM Inference
par: Xu, Yichun, et autres
Publié: (2026)
par: Xu, Yichun, et autres
Publié: (2026)
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
par: Wang, Suyuchen, et autres
Publié: (2025)
par: Wang, Suyuchen, et autres
Publié: (2025)
StarFlow: Generating Structured Workflow Outputs From Sketch Images
par: Bechard, Patrice, et autres
Publié: (2025)
par: Bechard, Patrice, et autres
Publié: (2025)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)
par: Li, Weizhuo, et autres
Publié: (2024)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
par: Song, Dinghong, et autres
Publié: (2025)
par: Song, Dinghong, et autres
Publié: (2025)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
par: Liu, Guangda, et autres
Publié: (2025)
par: Liu, Guangda, et autres
Publié: (2025)
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
par: Wan, Zhongwei, et autres
Publié: (2025)
par: Wan, Zhongwei, et autres
Publié: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
par: Zeng, Yixiao, et autres
Publié: (2026)
par: Zeng, Yixiao, et autres
Publié: (2026)
FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference
par: Li, Kunxi, et autres
Publié: (2025)
par: Li, Kunxi, et autres
Publié: (2025)
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing
par: Filippova, Anastasiia, et autres
Publié: (2026)
par: Filippova, Anastasiia, et autres
Publié: (2026)
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
par: Wang, Jiahao, et autres
Publié: (2026)
par: Wang, Jiahao, et autres
Publié: (2026)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
par: Dehghanighobadi, Zahra, et autres
Publié: (2026)
Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity
par: Ma, Da, et autres
Publié: (2024)
par: Ma, Da, et autres
Publié: (2024)
KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization
par: Hooper, Coleman, et autres
Publié: (2024)
par: Hooper, Coleman, et autres
Publié: (2024)
Documents similaires
-
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024) -
TACTiS-2: Better, Faster, Simpler Attentional Copulas for Multivariate Time Series
par: Ashok, Arjun, et autres
Publié: (2023) -
Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs
par: Ashok, Arjun, et autres
Publié: (2025) -
InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation
par: Sahu, Gaurav, et autres
Publié: (2024) -
Hierarchical Retrieval at Scale: Bridging Transparency and Efficiency
par: Gupta, Shubham, et autres
Publié: (2025)