Cita APA (7a ed.)

Ye, C., Xiong, W., Zhang, Y., Dong, H., Jiang, N., & Zhang, T. (2024). Online Iterative Reinforcement Learning from Human Feedback with General Preference Model.

Cita Chicago Style (17a ed.)

Ye, Chenlu, Wei Xiong, Yuheng Zhang, Hanze Dong, Nan Jiang, y Tong Zhang. Online Iterative Reinforcement Learning from Human Feedback with General Preference Model. 2024.

Cita MLA (9a ed.)

Ye, Chenlu, et al. Online Iterative Reinforcement Learning from Human Feedback with General Preference Model. 2024.

Precaución: Estas citas no son 100% exactas.