Jørgenvåg, M., Kaczér, D., Ruttert, L., Gülhan, M., Flek, L., & Mai, F. (2026). Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards.
Cita Chicago Style (17a ed.)Jørgenvåg, Magnus, David Kaczér, Lasse Ruttert, Marvin Gülhan, Lucie Flek, y Florian Mai. Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards. 2026.
Cita MLA (9a ed.)Jørgenvåg, Magnus, et al. Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards. 2026.
Precaución: Estas citas no son 100% exactas.