Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: McKee-Reid, Leo, Sträter, Christoph, Martinez, Maria Angelica, Needham, Joe, Balesni, Mikita
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!