Li, L., Qian, Y., Zhao, P., & Zhou, Z. (2025). Provably Efficient Online RLHF with One-Pass Reward Modeling.
Cita Chicago Style (17a ed.)Li, Long-Fei, Yu-Yang Qian, Peng Zhao, y Zhi-Hua Zhou. Provably Efficient Online RLHF with One-Pass Reward Modeling. 2025.
Cita MLA (9a ed.)Li, Long-Fei, et al. Provably Efficient Online RLHF with One-Pass Reward Modeling. 2025.
Precaución: Estas citas no son 100% exactas.