Skip to content
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Login
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Advanced
  • Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
Cover Image

Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Hubinger, Evan, Denison, Carson, Mu, Jesse, Lambert, Mike, Tong, Meg, MacDiarmid, Monte, Lanham, Tamera, Ziegler, Daniel M., Maxwell, Tim, Cheng, Newton, Jermyn, Adam, Askell, Amanda, Radhakrishnan, Ansh, Anil, Cem, Duvenaud, David, Ganguli, Deep, Barez, Fazl, Clark, Jack, Ndousse, Kamal, Sachan, Kshitij, Sellitto, Michael, Sharma, Mrinank, DasSarma, Nova, Grosse, Roger, Kravec, Shauna, Bai, Yuntao, Witten, Zachary, Favaro, Marina, Brauner, Jan, Karnofsky, Holden, Christiano, Paul, Bowman, Samuel R., Graham, Logan, Kaplan, Jared, Mindermann, Sören, Greenblatt, Ryan, Shlegeris, Buck, Schiefer, Nicholas, Perez, Ethan
Format: Preprint
Published: 2024
Subjects:
Cryptography and Security
Artificial Intelligence
Computation and Language
Machine Learning
Software Engineering
Online Access:
Acceder al recurso
Tags: Add Tag
No Tags, Be the first to tag this record!
  • Cite this
  • Text this
  • Email this
  • Print
  • Export Record
    • Export to RefWorks
    • Export to EndNoteWeb
    • Export to EndNote
  • Save to List
  • Permanent link
  • Holdings
  • Description
  • Comments
  • Similar Items
  • Staff View
Description
Description not available.

Similar Items

  • Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models
    by: Denison, Carson, et al.
    Published: (2024)
  • Alignment faking in large language models
    by: Greenblatt, Ryan, et al.
    Published: (2024)
  • Towards Understanding Sycophancy in Language Models
    by: Sharma, Mrinank, et al.
    Published: (2023)
  • Sabotage Evaluations for Frontier Models
    by: Benton, Joe, et al.
    Published: (2024)
  • Chain-of-Thought Hijacking
    by: Zhao, Jianli, et al.
    Published: (2025)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar