Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Liu, Jiacai, Wang, Chaojie, Liu, Chris Yuhao, Zeng, Liang, Yan, Rui, Sun, Yiwen, Liu, Yang, Zhou, Yahui
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!