Efficient Long-context Language Model Training by Core Attention Disaggregation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Zhuang, Yonghao, Chen, Junda, Pang, Bo, Gu, Yi, Zhu, Yibo, Jiang, Yimin, Stoica, Ion, Xing, Eric, Zhang, Hao
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires