DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Hu, Tianhao, Liu, Xiangcheng, Xiao, Youshao, Zheng, Yang, Huang, Xuan, Ding, Jinrui, Zhang, Yufei, Liang, Tao, Zang, Hongyu, Chen, Quan, Sun, Yueqing, Shi, Wenjie, Zhang, Chao, Wang, Wei, Gu, Qi, Sun, Yerui, Xie, Yucheng, Cai, Xunliang
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!