Nath, A., Jung, C., Seefried, E., & Krishnaswamy, N. (2024). Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both.
Cita Chicago Style (17a ed.)Nath, Abhijnan, Changsoo Jung, Ethan Seefried, y Nikhil Krishnaswamy. Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both. 2024.
Cita MLA (9a ed.)Nath, Abhijnan, et al. Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both. 2024.
Precaución: Estas citas no son 100% exactas.