Fan, J., Li, Y., Qi, Z., Zhang, D., Brantley, K., Kakade, S. M., & Zhang, H. (2026). Scaling Reward Modeling without Human Supervision.
Chicago-Zitierstil (17. Ausg.)Fan, Jingxuan, Yueying Li, Zhenting Qi, Dinghuai Zhang, Kianté Brantley, Sham M. Kakade, und Hanlin Zhang. Scaling Reward Modeling Without Human Supervision. 2026.
MLA-Zitierstil (9. Ausg.)Fan, Jingxuan, et al. Scaling Reward Modeling Without Human Supervision. 2026.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.