SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Lee, Jin, Chen, Zhonghao, He, Xuhang, Underwood, Robert, Nicolae, Bogdan, Cappello, Franck, Lu, Xiaoyi, Di, Sheng, Zhang, Zheng
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!