Liu, Q., Kline, A., & Wei, E. (2026). Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback.
Cita Chicago Style (17a ed.)Liu, Qiang, Adrienne Kline, y Ermin Wei. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback. 2026.
Cita MLA (9a ed.)Liu, Qiang, et al. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback. 2026.
Precaución: Estas citas no son 100% exactas.