SubGCache: Accelerating Graph-based RAG with Subgraph-level KV Cache
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Qiuyu, Zhang, Liang, Xu, Qianxiong, Long, Cheng, Zhang, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HierPromptLM: A Pure PLM-based Framework for Representation Learning on Heterogeneous Text-rich Networks
par: Zhu, Qiuyu, et autres
Publié: (2025)
par: Zhu, Qiuyu, et autres
Publié: (2025)
CacheClip: Accelerating RAG with Effective KV Cache Reuse
par: Yang, Bin, et autres
Publié: (2025)
par: Yang, Bin, et autres
Publié: (2025)
HHGT: Hierarchical Heterogeneous Graph Transformer for Heterogeneous Graph Representation Learning
par: Zhu, Qiuyu, et autres
Publié: (2024)
par: Zhu, Qiuyu, et autres
Publié: (2024)
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
par: Chen, Kaiwen, et autres
Publié: (2025)
par: Chen, Kaiwen, et autres
Publié: (2025)
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
par: Wu, Wenbo, et autres
Publié: (2025)
par: Wu, Wenbo, et autres
Publié: (2025)
KV Packet: Recomputation-Free Context-Independent KV Caching for LLMs
par: Chen, Chuangtao, et autres
Publié: (2026)
par: Chen, Chuangtao, et autres
Publié: (2026)
RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
par: Geng, Yingsheng, et autres
Publié: (2026)
par: Geng, Yingsheng, et autres
Publié: (2026)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
par: Jo, Dongwon, et autres
Publié: (2025)
par: Jo, Dongwon, et autres
Publié: (2025)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
par: Zheng, Haoyu, et autres
Publié: (2026)
par: Zheng, Haoyu, et autres
Publié: (2026)
CoKV: Optimizing KV Cache Allocation via Cooperative Game
par: Sun, Qiheng, et autres
Publié: (2025)
par: Sun, Qiheng, et autres
Publié: (2025)
Compute Or Load KV Cache? Why Not Both?
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
par: Liu, Mingrui, et autres
Publié: (2026)
par: Liu, Mingrui, et autres
Publié: (2026)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
par: Dong, Yanhao, et autres
Publié: (2025)
par: Dong, Yanhao, et autres
Publié: (2025)
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion
par: Yao, Jiayi, et autres
Publié: (2024)
par: Yao, Jiayi, et autres
Publié: (2024)
LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
Training Transformers for KV Cache Compressibility
par: Gelberg, Yoav, et autres
Publié: (2026)
par: Gelberg, Yoav, et autres
Publié: (2026)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024)
par: Liu, Guangda, et autres
Publié: (2024)
KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models
par: Roy, Sourjya, et autres
Publié: (2025)
par: Roy, Sourjya, et autres
Publié: (2025)
VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
par: Yao, Jiayi, et autres
Publié: (2026)
par: Yao, Jiayi, et autres
Publié: (2026)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
par: Corallo, Giulio, et autres
Publié: (2025)
par: Corallo, Giulio, et autres
Publié: (2025)
LagKV: Lag-Relative Information of the KV Cache Tells Which Tokens Are Important
par: Liang, Manlai, et autres
Publié: (2025)
par: Liang, Manlai, et autres
Publié: (2025)
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
The Pitfalls of KV Cache Compression
par: Chen, Alex, et autres
Publié: (2025)
par: Chen, Alex, et autres
Publié: (2025)
Sparse Attention across Multiple-context KV Cache
par: Cao, Ziyi, et autres
Publié: (2025)
par: Cao, Ziyi, et autres
Publié: (2025)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
par: Taneja, Maanas, et autres
Publié: (2026)
par: Taneja, Maanas, et autres
Publié: (2026)
ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration
par: Yan, Xianglong, et autres
Publié: (2025)
par: Yan, Xianglong, et autres
Publié: (2025)
Hierarchical Adaptive Eviction for KV Cache Management in Multimodal Language Models
par: Ma, Xindian, et autres
Publié: (2026)
par: Ma, Xindian, et autres
Publié: (2026)
ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
AlignedKV: Reducing Memory Access of KV-Cache with Precision-Aligned Quantization
par: Tan, Yifan, et autres
Publié: (2024)
par: Tan, Yifan, et autres
Publié: (2024)
ScoutAttention: Efficient KV Cache Offloading via Layer-Ahead CPU Pre-computation for LLM Inference
par: Zhang, Qiuyang, et autres
Publié: (2026)
par: Zhang, Qiuyang, et autres
Publié: (2026)
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
GNNVerifier: Graph-based Verifier for LLM Task Planning
par: Hao, Yu, et autres
Publié: (2026)
par: Hao, Yu, et autres
Publié: (2026)
CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving
par: Liu, Yuhan, et autres
Publié: (2023)
par: Liu, Yuhan, et autres
Publié: (2023)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
par: Zhu, Mengdan, et autres
Publié: (2025)
par: Zhu, Mengdan, et autres
Publié: (2025)
MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache
par: Sharma, Akshat, et autres
Publié: (2024)
par: Sharma, Akshat, et autres
Publié: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
par: Zhu, Yuxuan, et autres
Publié: (2025)
par: Zhu, Yuxuan, et autres
Publié: (2025)
MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse
par: Yu, Zichao, et autres
Publié: (2025)
par: Yu, Zichao, et autres
Publié: (2025)
Documents similaires
-
HierPromptLM: A Pure PLM-based Framework for Representation Learning on Heterogeneous Text-rich Networks
par: Zhu, Qiuyu, et autres
Publié: (2025) -
CacheClip: Accelerating RAG with Effective KV Cache Reuse
par: Yang, Bin, et autres
Publié: (2025) -
HHGT: Hierarchical Heterogeneous Graph Transformer for Heterogeneous Graph Representation Learning
par: Zhu, Qiuyu, et autres
Publié: (2024) -
ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing
par: Chen, Kaiwen, et autres
Publié: (2025) -
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
par: Wu, Wenbo, et autres
Publié: (2025)