Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: McGuinness, Max, Serrano, Alex, Bailey, Luke, Emmons, Scott
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!