Gespeichert in:
| Hauptverfasser: | Xie, Rui, Ma, Linsen, Zhong, Alex, Chen, Feng, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2411.03174 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
von: He, Yefei, et al.
Veröffentlicht: (2024)
von: He, Yefei, et al.
Veröffentlicht: (2024)
Memory Hierarchy — DRAM, HBM, and SSD-Backed Caches
von: Ivchenko, Oleh
Veröffentlicht: (2026)
von: Ivchenko, Oleh
Veröffentlicht: (2026)
Analysis and Evaluation of Using Microsecond-Latency Memory for In-Memory Indices and Caches in SSD-Based Key-Value Stores
von: Bando, Yosuke, et al.
Veröffentlicht: (2025)
von: Bando, Yosuke, et al.
Veröffentlicht: (2025)
Optimizing Intensive Database Tasks Through Caching Proxy Mechanisms
von: Moise, Ionut-Alex, et al.
Veröffentlicht: (2024)
von: Moise, Ionut-Alex, et al.
Veröffentlicht: (2024)
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
von: Kim, Jang-Hyun, et al.
Veröffentlicht: (2025)
von: Kim, Jang-Hyun, et al.
Veröffentlicht: (2025)
Adaptive KV-Cache Compression without Manually Setting Budget
von: Tang, Chenxia, et al.
Veröffentlicht: (2025)
von: Tang, Chenxia, et al.
Veröffentlicht: (2025)
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
von: Yan, Jianxin, et al.
Veröffentlicht: (2025)
von: Yan, Jianxin, et al.
Veröffentlicht: (2025)
Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching
von: Peng, Jie, et al.
Veröffentlicht: (2024)
von: Peng, Jie, et al.
Veröffentlicht: (2024)
Data Caching for Enterprise-Grade Petabyte-Scale OLAP
von: Tang, Chunxu, et al.
Veröffentlicht: (2024)
von: Tang, Chunxu, et al.
Veröffentlicht: (2024)
CS-PQ: Cache-Friendly SIMD Product Quantization for Large-Scale ANNS Index Construction
von: Ma, Y. T., et al.
Veröffentlicht: (2026)
von: Ma, Y. T., et al.
Veröffentlicht: (2026)
RAC: Relation-Aware Cache Replacement for Large Language Models
von: Wu, Yuchong, et al.
Veröffentlicht: (2026)
von: Wu, Yuchong, et al.
Veröffentlicht: (2026)
Learning-Augmented Online Caching: New Upper Bounds
von: Skachkov, Daniel, et al.
Veröffentlicht: (2024)
von: Skachkov, Daniel, et al.
Veröffentlicht: (2024)
Deuteronomy 2.0: Record Caching and Latch Freedom
von: Lomet, David
Veröffentlicht: (2025)
von: Lomet, David
Veröffentlicht: (2025)
Category-Aware Semantic Caching for Heterogeneous LLM Workloads
von: Wang, Chen, et al.
Veröffentlicht: (2025)
von: Wang, Chen, et al.
Veröffentlicht: (2025)
Leveraging Approximate Caching for Faster Retrieval-Augmented Generation
von: Bergman, Shai, et al.
Veröffentlicht: (2025)
von: Bergman, Shai, et al.
Veröffentlicht: (2025)
QCFuse: Query-Centric Cache Fusion for Efficient RAG Inference
von: Yan, Jianxin, et al.
Veröffentlicht: (2026)
von: Yan, Jianxin, et al.
Veröffentlicht: (2026)
DCMF: A Dynamic Context Monitoring and Caching Framework for Context Management Platforms
von: Manchanda, Ashish, et al.
Veröffentlicht: (2025)
von: Manchanda, Ashish, et al.
Veröffentlicht: (2025)
PUL: Pre-load in Software for Caches Wouldn't Always Play Along
von: Bernhardt, Arthur, et al.
Veröffentlicht: (2025)
von: Bernhardt, Arthur, et al.
Veröffentlicht: (2025)
DiskJoin: Large-scale Vector Similarity Join with SSD
von: Chen, Yanqi, et al.
Veröffentlicht: (2025)
von: Chen, Yanqi, et al.
Veröffentlicht: (2025)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
von: Wang, Dongwei, et al.
Veröffentlicht: (2025)
von: Wang, Dongwei, et al.
Veröffentlicht: (2025)
QVCache: A Query-Aware Vector Cache
von: Göçer, Anıl Eren, et al.
Veröffentlicht: (2026)
von: Göçer, Anıl Eren, et al.
Veröffentlicht: (2026)
MetaHive: A Cache-Optimized Metadata Management for Heterogeneous Key-Value Stores
von: Heidari, Alireza, et al.
Veröffentlicht: (2024)
von: Heidari, Alireza, et al.
Veröffentlicht: (2024)
Cache Coherence Over Disaggregated Memory
von: Wang, Ruihong, et al.
Veröffentlicht: (2024)
von: Wang, Ruihong, et al.
Veröffentlicht: (2024)
ZipFlow: a Compiler-based Framework to Unleash Compressed Data Movement for Modern GPUs
von: Yeo, Gwangoo, et al.
Veröffentlicht: (2026)
von: Yeo, Gwangoo, et al.
Veröffentlicht: (2026)
ZipLLM: Efficient LLM Storage via Model-Aware Synergistic Data Deduplication and Compression
von: Wang, Zirui, et al.
Veröffentlicht: (2025)
von: Wang, Zirui, et al.
Veröffentlicht: (2025)
Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics
von: Kim, Jungwoo, et al.
Veröffentlicht: (2025)
von: Kim, Jungwoo, et al.
Veröffentlicht: (2025)
On 10x Better Scalability: KV Stores Scale Up KV Cache
von: Yu, Weiping, et al.
Veröffentlicht: (2025)
von: Yu, Weiping, et al.
Veröffentlicht: (2025)
One-Hop Sub-Query Result Caches for Graph Database Systems
von: Nguyen, Hieu, et al.
Veröffentlicht: (2024)
von: Nguyen, Hieu, et al.
Veröffentlicht: (2024)
GoVector: An I/O-Efficient Caching Strategy for High-Dimensional Vector Nearest Neighbor Search
von: Zhou, Yijie, et al.
Veröffentlicht: (2025)
von: Zhou, Yijie, et al.
Veröffentlicht: (2025)
Optimizing SSD-Resident Graph Indexing for High-Throughput Vector Search
von: Zhao, Weichen, et al.
Veröffentlicht: (2026)
von: Zhao, Weichen, et al.
Veröffentlicht: (2026)
PFCS: Prime Factorization Cache System for Deterministic Data Relationship Discovery
von: Le, Duy
Veröffentlicht: (2025)
von: Le, Duy
Veröffentlicht: (2025)
Memory Hierarchy Design for Caching Middleware in the Age of NVM
von: Ghandeharizadeh, Shahram, et al.
Veröffentlicht: (2025)
von: Ghandeharizadeh, Shahram, et al.
Veröffentlicht: (2025)
SAM: A Stability-Aware Cache Manager for Multi-Tenant Embedded Databases
von: Zhang, Haoran, et al.
Veröffentlicht: (2025)
von: Zhang, Haoran, et al.
Veröffentlicht: (2025)
ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
von: Qi, Yanlin, et al.
Veröffentlicht: (2026)
von: Qi, Yanlin, et al.
Veröffentlicht: (2026)
A Generative Caching System for Large Language Models
von: Iyengar, Arun, et al.
Veröffentlicht: (2025)
von: Iyengar, Arun, et al.
Veröffentlicht: (2025)
Towards Efficient Flash Caches with Emerging NVMe Flexible Data Placement SSDs
von: Allison, Michael, et al.
Veröffentlicht: (2025)
von: Allison, Michael, et al.
Veröffentlicht: (2025)
Efficient Distributed Exact Subgraph Matching via GNN-PE: Load Balancing, Cache Optimization, and Query Plan Ranking
von: Wang, Yu, et al.
Veröffentlicht: (2025)
von: Wang, Yu, et al.
Veröffentlicht: (2025)
PipeANN-Filter: An Efficient Filtered Vector Search System on SSD
von: Guo, Hao, et al.
Veröffentlicht: (2026)
von: Guo, Hao, et al.
Veröffentlicht: (2026)
Quota management in dCache or making a perfectly normal file system normal
von: Litvintsev, Dmitry, et al.
Veröffentlicht: (2024)
von: Litvintsev, Dmitry, et al.
Veröffentlicht: (2024)
Exploring DRAM Cache Prefetching for Pooled Memory
von: Tirumalasetty, Chandrahas, et al.
Veröffentlicht: (2024)
von: Tirumalasetty, Chandrahas, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification
von: He, Yefei, et al.
Veröffentlicht: (2024) -
Memory Hierarchy — DRAM, HBM, and SSD-Backed Caches
von: Ivchenko, Oleh
Veröffentlicht: (2026) -
Analysis and Evaluation of Using Microsecond-Latency Memory for In-Memory Indices and Caches in SSD-Based Key-Value Stores
von: Bando, Yosuke, et al.
Veröffentlicht: (2025) -
Optimizing Intensive Database Tasks Through Caching Proxy Mechanisms
von: Moise, Ionut-Alex, et al.
Veröffentlicht: (2024) -
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
von: Kim, Jang-Hyun, et al.
Veröffentlicht: (2025)