Wen, J., Zhong, R., Khan, A., Perez, E., Steinhardt, J., Huang, M., . . . Feng, S. (2024). Language Models Learn to Mislead Humans via RLHF.
Chicago-Zitierstil (17. Ausg.)Wen, Jiaxin, Ruiqi Zhong, Akbir Khan, Ethan Perez, Jacob Steinhardt, Minlie Huang, Samuel R. Bowman, He He, und Shi Feng. Language Models Learn to Mislead Humans via RLHF. 2024.
MLA-Zitierstil (9. Ausg.)Wen, Jiaxin, et al. Language Models Learn to Mislead Humans via RLHF. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.