ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Yanlin, Chen, Xinhang, Jiang, Huiqiang, Wang, Qitong, Peng, Botao, Palpanas, Themis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SEAnet: A Deep Learning Architecture for Data Series Similarity Search
di: Wang, Qitong, et al.
Pubblicazione: (2026)
di: Wang, Qitong, et al.
Pubblicazione: (2026)
LeaFi: Data Series Indexes on Steroids with Learned Filters
di: Wang, Qitong, et al.
Pubblicazione: (2025)
di: Wang, Qitong, et al.
Pubblicazione: (2025)
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
di: Li, Yucheng, et al.
Pubblicazione: (2024)
di: Li, Yucheng, et al.
Pubblicazione: (2024)
Fast and Exact Similarity Search in less than a Blink of an Eye
di: Schäfer, Patrick, et al.
Pubblicazione: (2024)
di: Schäfer, Patrick, et al.
Pubblicazione: (2024)
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2025)
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2025)
DET-LSH: A Locality-Sensitive Hashing Scheme with Dynamic Encoding Tree for Approximate Nearest Neighbor Search
di: Wei, Jiuqi, et al.
Pubblicazione: (2024)
di: Wei, Jiuqi, et al.
Pubblicazione: (2024)
Automated Data Quality Validation in an End-to-End GNN Framework
di: Dong, Sijie, et al.
Pubblicazione: (2025)
di: Dong, Sijie, et al.
Pubblicazione: (2025)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
di: Sun, Hanshi, et al.
Pubblicazione: (2024)
DumpyOS: A Data-Adaptive Multi-ary Index for Scalable Data Series Similarity Search
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
di: Jo, Dongwon, et al.
Pubblicazione: (2025)
di: Jo, Dongwon, et al.
Pubblicazione: (2025)
Subspace Collision: An Efficient and Accurate Framework for High-dimensional Approximate Nearest Neighbor Search
di: Wei, Jiuqi, et al.
Pubblicazione: (2024)
di: Wei, Jiuqi, et al.
Pubblicazione: (2024)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
di: Wang, Dongwei, et al.
Pubblicazione: (2025)
di: Wang, Dongwei, et al.
Pubblicazione: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
di: Nadali, Alireza, et al.
Pubblicazione: (2026)
CTkvr: KV Cache Retrieval for Long-Context LLMs via Centroid then Token Indexing
di: Lu, Kuan, et al.
Pubblicazione: (2025)
di: Lu, Kuan, et al.
Pubblicazione: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
di: Behnam, Payman, et al.
Pubblicazione: (2025)
di: Behnam, Payman, et al.
Pubblicazione: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
di: Chang, Chi-Chih, et al.
Pubblicazione: (2025)
ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution
di: Dong, Zican, et al.
Pubblicazione: (2026)
di: Dong, Zican, et al.
Pubblicazione: (2026)
$\boldsymbol{Steiner}$-Hardness: A Query Hardness Measure for Graph-Based ANN Indexes
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning
di: Lin, Xiaotian, et al.
Pubblicazione: (2025)
di: Lin, Xiaotian, et al.
Pubblicazione: (2025)
DaiSy: A Library for Scalable Data Series Similarity Search
di: Del Gaudio, Francesca, et al.
Pubblicazione: (2026)
di: Del Gaudio, Francesca, et al.
Pubblicazione: (2026)
FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference
di: Liu, Guangda, et al.
Pubblicazione: (2025)
di: Liu, Guangda, et al.
Pubblicazione: (2025)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
di: Zhou, Xiabin, et al.
Pubblicazione: (2024)
IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
di: Mao, Yuzhen, et al.
Pubblicazione: (2026)
On 10x Better Scalability: KV Stores Scale Up KV Cache
di: Yu, Weiping, et al.
Pubblicazione: (2025)
di: Yu, Weiping, et al.
Pubblicazione: (2025)
PDET-LSH: Scalable In-Memory Indexing for High-Dimensional Approximate Nearest Neighbor Search with Quality Guarantees
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
di: Wei, Jiuqi, et al.
Pubblicazione: (2026)
RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations
di: Su, Zunhai, et al.
Pubblicazione: (2025)
di: Su, Zunhai, et al.
Pubblicazione: (2025)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
di: Dzikanyanga, Gradwell, et al.
Pubblicazione: (2026)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
di: Li, Weizhuo, et al.
Pubblicazione: (2024)
KV Cache Offloading for Context-Intensive Tasks
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
di: Bocharnikov, Andrey, et al.
Pubblicazione: (2026)
Dimensionality-Reduction Techniques for Approximate Nearest Neighbor Search: A Survey and Evaluation
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
NestedKV: Nested Memory Routing for Long-Context KV Cache Compression
di: Chen, Hong, et al.
Pubblicazione: (2026)
di: Chen, Hong, et al.
Pubblicazione: (2026)
KVSculpt: KV Cache Compression as Distillation
di: Jiang, Bo, et al.
Pubblicazione: (2026)
di: Jiang, Bo, et al.
Pubblicazione: (2026)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
di: Wang, Guangtao, et al.
Pubblicazione: (2025)
CSKV: Training-Efficient Channel Shrinking for KV Cache in Long-Context Scenarios
di: Wang, Luning, et al.
Pubblicazione: (2024)
di: Wang, Luning, et al.
Pubblicazione: (2024)
KVzap: Fast, Adaptive, and Faithful KV Cache Pruning
di: Jegou, Simon, et al.
Pubblicazione: (2026)
di: Jegou, Simon, et al.
Pubblicazione: (2026)
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
di: Yan, Jianxin, et al.
Pubblicazione: (2025)
di: Yan, Jianxin, et al.
Pubblicazione: (2025)
Beyond KV Caching: Shared Attention for Efficient LLMs
di: Liao, Bingli, et al.
Pubblicazione: (2024)
di: Liao, Bingli, et al.
Pubblicazione: (2024)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SEAnet: A Deep Learning Architecture for Data Series Similarity Search
di: Wang, Qitong, et al.
Pubblicazione: (2026) -
LeaFi: Data Series Indexes on Steroids with Learned Filters
di: Wang, Qitong, et al.
Pubblicazione: (2025) -
SCBench: A KV Cache-Centric Analysis of Long-Context Methods
di: Li, Yucheng, et al.
Pubblicazione: (2024) -
Fast and Exact Similarity Search in less than a Blink of an Eye
di: Schäfer, Patrick, et al.
Pubblicazione: (2024) -
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
di: Kim, Jang-Hyun, et al.
Pubblicazione: (2025)