Ye, C., Xiong, W., Zhang, Y., Dong, H., Jiang, N., & Zhang, T. (2024). Online Iterative Reinforcement Learning from Human Feedback with General Preference Model.
Style de citation Chicago (17e éd.)Ye, Chenlu, Wei Xiong, Yuheng Zhang, Hanze Dong, Nan Jiang, et Tong Zhang. Online Iterative Reinforcement Learning from Human Feedback with General Preference Model. 2024.
Style de citation MLA (9e éd.)Ye, Chenlu, et al. Online Iterative Reinforcement Learning from Human Feedback with General Preference Model. 2024.
Attention : ces citations peuvent ne pas être correctes à 100%.