Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Wang, Binghai, Liu, Yantao, Liu, Yuxuan, Tang, Tianyi, Wang, Shenzhi, Gao, Chang, Zheng, Chujie, Zhang, Yichang, Yu, Le, Liu, Shixuan, Gui, Tao, Zhang, Qi, Huang, Xuanjing, Yu, Bowen, Huang, Fei, Lin, Junyang
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!