RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Behnam, Payman, Fu, Yaosheng, Zhao, Ritchie, Tsai, Po-An, Yu, Zhiding, Tumanov, Alexey
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!