LLM-PRISM: Characterizing Silent Data Corruption from Permanent GPU Faults in LLM Training

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Tyagi, Abhishek, Hukerikar, Saurabh, Saxena, Nirmal, Huang, Yanxiang, Shirvani, Philip, Tung, Chung-Hsuan, Zhu, Yuhao
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!