Tsuchiya, T., Ito, S., & Luo, H. (2025). Reinforcement Learning from Adversarial Preferences in Tabular MDPs.
Cita Chicago Style (17a ed.)Tsuchiya, Taira, Shinji Ito, y Haipeng Luo. Reinforcement Learning from Adversarial Preferences in Tabular MDPs. 2025.
Cita MLA (9a ed.)Tsuchiya, Taira, et al. Reinforcement Learning from Adversarial Preferences in Tabular MDPs. 2025.
Precaución: Estas citas no son 100% exactas.