Shianifar, J., Schukat, M., & Mason, K. (2026). Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning.
Cita Chicago Style (17a ed.)Shianifar, Jonaid, Michael Schukat, y Karl Mason. Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning. 2026.
Cita MLA (9a ed.)Shianifar, Jonaid, et al. Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning. 2026.
Precaución: Estas citas no son 100% exactas.