Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Pei-Shuo, Chen, Jian-Jia, Yang, Chun-Che, Chang, Chi-Chih, Huang, Ning-Chi, Abdelfattah, Mohamed S., Wu, Kai-Chiang
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!