Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Binghai, Liu, Yantao, Liu, Yuxuan, Tang, Tianyi, Wang, Shenzhi, Gao, Chang, Zheng, Chujie, Zhang, Yichang, Yu, Le, Liu, Shixuan, Gui, Tao, Zhang, Qi, Huang, Xuanjing, Yu, Bowen, Huang, Fei, Lin, Junyang
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!