Maura-Rivero, R., Nagpal, C., Patel, R., & Visin, F. (2025). Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models.
Style de citation Chicago (17e éd.)Maura-Rivero, Roberto-Rafael, Chirag Nagpal, Roma Patel, et Francesco Visin. Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models. 2025.
Style de citation MLA (9e éd.)Maura-Rivero, Roberto-Rafael, et al. Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models. 2025.
Attention : ces citations peuvent ne pas être correctes à 100%.