Ahmed, A. M., Rafailov, R., Sharkov, S., Li, X., & Koyejo, S. (2024). Scalable Ensembling For Mitigating Reward Overoptimisation.
Chicago-Zitierstil (17. Ausg.)Ahmed, Ahmed M., Rafael Rafailov, Stepan Sharkov, Xuechen Li, und Sanmi Koyejo. Scalable Ensembling For Mitigating Reward Overoptimisation. 2024.
MLA-Zitierstil (9. Ausg.)Ahmed, Ahmed M., et al. Scalable Ensembling For Mitigating Reward Overoptimisation. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.