SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Lee, Jin, Chen, Zhonghao, He, Xuhang, Underwood, Robert, Nicolae, Bogdan, Cappello, Franck, Lu, Xiaoyi, Di, Sheng, Zhang, Zheng
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!