gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Guo, Tianyu, Zhang, Xianwei, Du, Jiangsu, Chen, Zhiguang, Xiao, Nong, Lu, Yutong
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!