GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Kang, Hao, Zhang, Qingru, Kundu, Souvik, Jeong, Geonhwa, Liu, Zaoxing, Krishna, Tushar, Zhao, Tuo
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!