Zhang, G., Bao, H., & Kashima, H. (2024). Online Policy Learning from Offline Preferences.
Chicago-Zitierstil (17. Ausg.)Zhang, Guoxi, Han Bao, und Hisashi Kashima. Online Policy Learning from Offline Preferences. 2024.
MLA-Zitierstil (9. Ausg.)Zhang, Guoxi, et al. Online Policy Learning from Offline Preferences. 2024.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.