Liu, T., Xiong, W., Ren, J., Chen, L., Wu, J., Joshi, R., . . . Saleh, M. (2024). RRM: Robust Reward Model Training Mitigates Reward Hacking.
Cita Chicago Style (17a ed.)Liu, Tianqi, et al. RRM: Robust Reward Model Training Mitigates Reward Hacking. 2024.
Cita MLA (9a ed.)Liu, Tianqi, et al. RRM: Robust Reward Model Training Mitigates Reward Hacking. 2024.
Precaución: Estas citas no son 100% exactas.