Cita APA (7a ed.)

Liu, T., Xiong, W., Ren, J., Chen, L., Wu, J., Joshi, R., . . . Saleh, M. (2024). RRM: Robust Reward Model Training Mitigates Reward Hacking.

Cita Chicago Style (17a ed.)

Liu, Tianqi, et al. RRM: Robust Reward Model Training Mitigates Reward Hacking. 2024.

Cita MLA (9a ed.)

Liu, Tianqi, et al. RRM: Robust Reward Model Training Mitigates Reward Hacking. 2024.

Precaución: Estas citas no son 100% exactas.