Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Xia, Han, Gao, Songyang, Ge, Qiming, Xi, Zhiheng, Zhang, Qi, Huang, Xuanjing
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!