Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Song, Jingwei, Chen, Wanyi, Song, Xinyuan, Max, Tong, Chris, Chen, Gufeng, Zhao, Tianyi, Yang, Eric, Shi, Bill, Ai, Lynn
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!