Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: McKee-Reid, Leo, Sträter, Christoph, Martinez, Maria Angelica, Needham, Joe, Balesni, Mikita
Format: Preprint
Veröffentlicht: 2024
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!