Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Qianli, Liu, Zicong, Hong, Fahao, Chen, Peng, Li, Song, Guo
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!