InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Chen, Qiaoling, Gu, Diandian, Wang, Guoteng, Chen, Xun, Xiong, YingTong, Huang, Ting, Hu, Qinghao, Jin, Xin, Wen, Yonggang, Zhang, Tianwei, Sun, Peng
Format: Preprint
Publié: 2024
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!