Zhou, R., Fazel, M., & Du, S. S. (2025). Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback.
Chicago Style (17th ed.) CitationZhou, Runlong, Maryam Fazel, and Simon S. Du. Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback. 2025.
MLA (9th ed.) CitationZhou, Runlong, et al. Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback. 2025.
Warning: These citations may not always be 100% accurate.