Pukdee, R., Balcan, M., & Ravikumar, P. (2026). Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles.
Chicago Style (17th ed.) CitationPukdee, Rattana, Maria-Florina Balcan, and Pradeep Ravikumar. Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles. 2026.
MLA (9th ed.) CitationPukdee, Rattana, et al. Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles. 2026.
Warning: These citations may not always be 100% accurate.