Kumar, A., Zhuang, V., Agarwal, R., Su, Y., Co-Reyes, J. D., Singh, A., . . . Faust, A. (2024). Training Language Models to Self-Correct via Reinforcement Learning.
Chicago-Zitierstil (17. Ausg.)Kumar, Aviral, et al. Training Language Models to Self-Correct via Reinforcement Learning. 2024.
MLA-Zitierstil (9. Ausg.)Kumar, Aviral, et al. Training Language Models to Self-Correct via Reinforcement Learning. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.