From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Wang, Jiahao, Xie, Weiyu, Zhang, Mingxing, Zhang, Boxing, Dong, Jianwei, Zhu, Yuening, Lin, Chen, Tang, Jinqi, Han, Yaochen, Ai, Zhiyuan, Chen, Xianglin, Wu, Yongwei, Jiang, Congfeng
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!