DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Lin, Shouxu, Guo, Zhiyuan, Lin, Jiaxin
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!