Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ma, Da, Chen, Lu, Zhang, Situo, Miao, Yuxun, Zhu, Su, Chen, Zhi, Xu, Hongshen, Li, Hanqi, Fan, Shuai, Pan, Lei, Yu, Kai
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!