SpecOffload: Unlocking Latent GPU Capacity for LLM Inference on Resource-Constrained Devices

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Zhuge, Xiangwen, Shen, Xu, Wang, Zeyu, Dang, Fan, Ding, Xuan, Li, Danyang, Han, Yahui, Hao, Tianxiang, Yang, Zheng
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires