APA (7th ed.) Citation

Zhu, B., Jordan, M. I., & Jiao, J. (2024). Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF.

Chicago Style (17th ed.) Citation

Zhu, Banghua, Michael I. Jordan, and Jiantao Jiao. Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF. 2024.

MLA (9th ed.) Citation

Zhu, Banghua, et al. Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF. 2024.

Warning: These citations may not always be 100% accurate.