Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Vooturi, Dharma Teja, Kalamkar, Dhiraj, Das, Dipankar, Kaul, Bharat
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!