Maura-Rivero, R., Nagpal, C., Patel, R., & Visin, F. (2025). Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models.
Chicago-Zitierstil (17. Ausg.)Maura-Rivero, Roberto-Rafael, Chirag Nagpal, Roma Patel, und Francesco Visin. Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models. 2025.
MLA-Zitierstil (9. Ausg.)Maura-Rivero, Roberto-Rafael, et al. Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models. 2025.
Achtung: Diese Zitate sind unter Umständen nicht zu 100% korrekt.