On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Agarwal, Rishabh, Vieillard, Nino, Zhou, Yongchao, Stanczyk, Piotr, Ramos, Sabela, Geist, Matthieu, Bachem, Olivier
Formato: Preprint
Publicado: 2023
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!