QCFuse: Query-Centric Cache Fusion for Efficient RAG Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Jianxin, Qian, Zeheng, Ni, Wangze, Shen, Zhitao, Wang, Zhiping, Li, Haoyang, Zhu, Jia, Chen, Lei, Ren, Kui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
par: Yan, Jianxin, et autres
Publié: (2025)
par: Yan, Jianxin, et autres
Publié: (2025)
RAC: Relation-Aware Cache Replacement for Large Language Models
par: Wu, Yuchong, et autres
Publié: (2026)
par: Wu, Yuchong, et autres
Publié: (2026)
SINDI: an Efficient Index for Approximate Maximum Inner Product Search on Sparse Vectors
par: Li, Ruoxuan, et autres
Publié: (2025)
par: Li, Ruoxuan, et autres
Publié: (2025)
Efficient Multiple Temporal Network Kernel Density Estimation
par: Shao, Yu, et autres
Publié: (2025)
par: Shao, Yu, et autres
Publié: (2025)
StructRide: A Framework to Exploit the Structure Information of Shareability Graph in Ridesharing
par: Zhan, Jiexi, et autres
Publié: (2024)
par: Zhan, Jiexi, et autres
Publié: (2024)
RelServe: Fast LLM Inference Serving on Relational Data
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
FIER: Fine-Grained and Efficient KV Cache Retrieval for Long-context LLM Inference
par: Wang, Dongwei, et autres
Publié: (2025)
par: Wang, Dongwei, et autres
Publié: (2025)
Numerical Estimation of Spatial Distributions under Differential Privacy
par: Du, Leilei, et autres
Publié: (2024)
par: Du, Leilei, et autres
Publié: (2024)
Wait to be Faster: a Smart Pooling Framework for Dynamic Ridesharing
par: Zhong, Xiaoyao, et autres
Publié: (2024)
par: Zhong, Xiaoyao, et autres
Publié: (2024)
SRBench: A Comprehensive Benchmark for Sequential Recommendation with Large Language Models
par: Li, Jianhong, et autres
Publié: (2026)
par: Li, Jianhong, et autres
Publié: (2026)
OCPQ: Object-Centric Process Querying & Constraints
par: Küsters, Aaron, et autres
Publié: (2025)
par: Küsters, Aaron, et autres
Publié: (2025)
A Query Optimization Method Utilizing Large Language Models
par: Yao, Zhiming, et autres
Publié: (2025)
par: Yao, Zhiming, et autres
Publié: (2025)
EnhanceGraph: A Continuously Enhanced Graph-based Index for High-dimensional Approximate Nearest Neighbor Search
par: Zhong, Xiaoyao, et autres
Publié: (2025)
par: Zhong, Xiaoyao, et autres
Publié: (2025)
Zero-Knowledge Verifiable Graph Query Evaluation via Expansion-Centric Operator Decomposition
par: Wu, Hao, et autres
Publié: (2025)
par: Wu, Hao, et autres
Publié: (2025)
Efficient Distributed Exact Subgraph Matching via GNN-PE: Load Balancing, Cache Optimization, and Query Plan Ranking
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
AQETuner: Reliable Query-level Configuration Tuning for Analytical Query Engines
par: Chen, Lixiang, et autres
Publié: (2025)
par: Chen, Lixiang, et autres
Publié: (2025)
Declarative Privacy-Preserving Inference Queries
par: Guan, Hong, et autres
Publié: (2024)
par: Guan, Hong, et autres
Publié: (2024)
One-Hop Sub-Query Result Caches for Graph Database Systems
par: Nguyen, Hieu, et autres
Publié: (2024)
par: Nguyen, Hieu, et autres
Publié: (2024)
Efficient Densest Flow Queries in Transaction Flow Networks (Complete Version)
par: Jiang, Jiaxin, et autres
Publié: (2026)
par: Jiang, Jiaxin, et autres
Publié: (2026)
LLMLog: Advanced Log Template Generation via LLM-driven Multi-Round Annotation
par: Teng, Fei, et autres
Publié: (2025)
par: Teng, Fei, et autres
Publié: (2025)
MobileRAG: A Fast, Memory-Efficient, and Energy-Efficient Method for On-Device RAG
par: Park, Taehwan, et autres
Publié: (2025)
par: Park, Taehwan, et autres
Publié: (2025)
KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
par: Kim, Jang-Hyun, et autres
Publié: (2025)
par: Kim, Jang-Hyun, et autres
Publié: (2025)
SEFRQO: A Self-Evolving Fine-Tuned RAG-Based Query Optimizer
par: Liu, Hanwen, et autres
Publié: (2025)
par: Liu, Hanwen, et autres
Publié: (2025)
Data Path Fusion in GPU for Analytical Query Processing
par: Ozawa, Tsuyoshi, et autres
Publié: (2026)
par: Ozawa, Tsuyoshi, et autres
Publié: (2026)
Efficient Cloud-edge Collaborative Approaches to SPARQL Queries over Large RDF graphs
par: Ma, Shidan, et autres
Publié: (2026)
par: Ma, Shidan, et autres
Publié: (2026)
LIVE: Learnable Monotonic Vertex Embedding for Efficient Exact Subgraph Matching (Technical Report)
par: Ye, Yutong, et autres
Publié: (2026)
par: Ye, Yutong, et autres
Publié: (2026)
$\textit{Dirigo}$: A Method to Extract Event Logs for Object-Centric Processes
par: Wei, Jia, et autres
Publié: (2024)
par: Wei, Jia, et autres
Publié: (2024)
Approximate Nearest Neighbor Search of Large Scale Vectors on Distributed Storage
par: Yu, Kun, et autres
Publié: (2025)
par: Yu, Kun, et autres
Publié: (2025)
Towards Efficient Random-Order Enumeration for Join Queries
par: Chen, Pengyu, et autres
Publié: (2025)
par: Chen, Pengyu, et autres
Publié: (2025)
MorphingDB: A Task-Centric AI-Native DBMS for Model Management and Inference
par: Sai, Wu, et autres
Publié: (2025)
par: Sai, Wu, et autres
Publié: (2025)
Efficient k-step Weighted Reachability Query Processing Algorithms
par: Mei, Congquan, et autres
Publié: (2024)
par: Mei, Congquan, et autres
Publié: (2024)
QVCache: A Query-Aware Vector Cache
par: Göçer, Anıl Eren, et autres
Publié: (2026)
par: Göçer, Anıl Eren, et autres
Publié: (2026)
ZipCache: A DRAM/SSD Cache with Built-in Transparent Compression
par: Xie, Rui, et autres
Publié: (2024)
par: Xie, Rui, et autres
Publié: (2024)
Efficient Query Repair for Aggregate Constraints
par: Algarni, Shatha, et autres
Publié: (2025)
par: Algarni, Shatha, et autres
Publié: (2025)
Maximum Inner Product is Query-Scaled Nearest Neighbor
par: Chen, Tingyang, et autres
Publié: (2025)
par: Chen, Tingyang, et autres
Publié: (2025)
GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization
par: Tang, Tianhao, et autres
Publié: (2026)
par: Tang, Tianhao, et autres
Publié: (2026)
RapidStore: An Efficient Dynamic Graph Storage System for Concurrent Queries
par: Hao, Chiyu, et autres
Publié: (2025)
par: Hao, Chiyu, et autres
Publié: (2025)
ESG: Elastic Graphs for Range-Filtering Approximate k-Nearest Neighbor Search
par: Yang, Mingyu, et autres
Publié: (2025)
par: Yang, Mingyu, et autres
Publié: (2025)
Object-Centric Analysis of XES Event Logs: Integrating OCED Modeling with SPARQL Queries
par: Latif, Saba, et autres
Publié: (2025)
par: Latif, Saba, et autres
Publié: (2025)
FGIM: a Fast Graph-based Indexes Merging Framework for Approximate Nearest Neighbor Search
par: Wu, Zekai, et autres
Publié: (2026)
par: Wu, Zekai, et autres
Publié: (2026)
Documents similaires
-
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
par: Yan, Jianxin, et autres
Publié: (2025) -
RAC: Relation-Aware Cache Replacement for Large Language Models
par: Wu, Yuchong, et autres
Publié: (2026) -
SINDI: an Efficient Index for Approximate Maximum Inner Product Search on Sparse Vectors
par: Li, Ruoxuan, et autres
Publié: (2025) -
Efficient Multiple Temporal Network Kernel Density Estimation
par: Shao, Yu, et autres
Publié: (2025) -
StructRide: A Framework to Exploit the Structure Information of Shareability Graph in Ridesharing
par: Zhan, Jiexi, et autres
Publié: (2024)