Liu, Q., Kline, A., & Wei, E. (2026). Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback.
Citazione stile Chigago Style (17a edizione)Liu, Qiang, Adrienne Kline, e Ermin Wei. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback. 2026.
Citatione MLA (9a ed.)Liu, Qiang, et al. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback. 2026.
Attenzione: Queste citazioni potrebbero non essere precise al 100%.