Chen, Z., Liu, F., Zhu, X., Qi, Y., & Ghavamzadeh, M. (2025). Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator.
Chicago-Zitierstil (17. Ausg.)Chen, Zhuotong, Fang Liu, Xuan Zhu, Yanjun Qi, und Mohammad Ghavamzadeh. Preference Optimization via Contrastive Divergence: Your Reward Model Is Secretly an NLL Estimator. 2025.
MLA-Zitierstil (9. Ausg.)Chen, Zhuotong, et al. Preference Optimization via Contrastive Divergence: Your Reward Model Is Secretly an NLL Estimator. 2025.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.