Jiang, X., Zhou, Y., Cao, S., Stoica, I., & Yu, M. (2024). NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference.
Chicago-Zitierstil (17. Ausg.)Jiang, Xuanlin, Yang Zhou, Shiyi Cao, Ion Stoica, und Minlan Yu. NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference. 2024.
MLA-Zitierstil (9. Ausg.)Jiang, Xuanlin, et al. NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.