HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Shi, Zhiyuan, Qiu, Qibo, Xue, Feng, Jiang, Zhonglin, Yu, Li, Jiang, Jian, He, Xiaofei, Wang, Wenxiao
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!