Zhang, H., Gui, L., Zhai, Y., Wang, H., Lei, Y., & Xu, R. (2023). COPR: Continual Learning Human Preference through Optimal Policy Regularization.
Chicago Style (17th ed.) CitationZhang, Han, Lin Gui, Yuanzhao Zhai, Hui Wang, Yu Lei, and Ruifeng Xu. COPR: Continual Learning Human Preference Through Optimal Policy Regularization. 2023.
MLA (9th ed.) CitationZhang, Han, et al. COPR: Continual Learning Human Preference Through Optimal Policy Regularization. 2023.
Warning: These citations may not always be 100% accurate.