Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Li, Derek, Zhou, Jiaming, Brunswic, Leo Maxime, Ghaddar, Abbas, Sun, Qianyi, Ma, Liheng, Luo, Yu, Li, Dong, Coates, Mark, Hao, Jianye, Zhang, Yingxue
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!