Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Zhang, Qingru, Qiu, Liang, Hong, Ilgee, Xu, Zhenghao, Liu, Tianyi, Li, Shiyang, Zhang, Rongzhi, Li, Zheng, Li, Lihong, Yin, Bing, Zhang, Chao, Chen, Jianshu, Jiang, Haoming, Zhao, Tuo
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!