Zhai, Y., Zhang, H., Lei, Y., Yu, Y., Xu, K., Feng, D., . . . Wang, H. (2023). Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles.
Cita Chicago Style (17a ed.)Zhai, Yuanzhao, Han Zhang, Yu Lei, Yue Yu, Kele Xu, Dawei Feng, Bo Ding, y Huaimin Wang. Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles. 2023.
Cita MLA (9a ed.)Zhai, Yuanzhao, et al. Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles. 2023.
Precaución: Estas citas no son 100% exactas.