APA-Zitierstil (7. Ausg.)

Chen, Z., Liu, F., Zhu, X., Qi, Y., & Ghavamzadeh, M. (2025). Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator.

Chicago-Zitierstil (17. Ausg.)

Chen, Zhuotong, Fang Liu, Xuan Zhu, Yanjun Qi, und Mohammad Ghavamzadeh. Preference Optimization via Contrastive Divergence: Your Reward Model Is Secretly an NLL Estimator. 2025.

MLA-Zitierstil (9. Ausg.)

Chen, Zhuotong, et al. Preference Optimization via Contrastive Divergence: Your Reward Model Is Secretly an NLL Estimator. 2025.

Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.