Skip to content
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Login
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Advanced
  • Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
Cover Image

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Korbak, Tomek, Balesni, Mikita, Barnes, Elizabeth, Bengio, Yoshua, Benton, Joe, Bloom, Joseph, Chen, Mark, Cooney, Alan, Dafoe, Allan, Dragan, Anca, Emmons, Scott, Evans, Owain, Farhi, David, Greenblatt, Ryan, Hendrycks, Dan, Hobbhahn, Marius, Hubinger, Evan, Irving, Geoffrey, Jenner, Erik, Kokotajlo, Daniel, Krakovna, Victoria, Legg, Shane, Lindner, David, Luan, David, Mądry, Aleksander, Michael, Julian, Nanda, Neel, Orr, Dave, Pachocki, Jakub, Perez, Ethan, Phuong, Mary, Roger, Fabien, Saxe, Joshua, Shlegeris, Buck, Soto, Martín, Steinberger, Eric, Wang, Jasmine, Zaremba, Wojciech, Baker, Bowen, Shah, Rohin, Mikulik, Vlad
Format: Preprint
Published: 2025
Subjects:
Artificial Intelligence
Machine Learning
Online Access:
Acceder al recurso
Tags: Add Tag
No Tags, Be the first to tag this record!
  • Cite this
  • Text this
  • Email this
  • Print
  • Export Record
    • Export to RefWorks
    • Export to EndNoteWeb
    • Export to EndNote
  • Save to List
  • Permanent link
  • Holdings
  • Description
  • Comments
  • Similar Items
  • Staff View

Internet

https://arxiv.org/abs/2507.11473

Similar Items

  • Lessons from Studying Two-Hop Latent Reasoning
    by: Balesni, Mikita, et al.
    Published: (2024)
  • How to evaluate control measures for LLM agents? A trajectory from today to superintelligence
    by: Korbak, Tomek, et al.
    Published: (2025)
  • Towards evaluations-based safety cases for AI scheming
    by: Balesni, Mikita, et al.
    Published: (2024)
  • Large Language Models can Strategically Deceive their Users when Put Under Pressure
    by: Scheurer, Jérémy, et al.
    Published: (2023)
  • The Reversal Curse: LLMs trained on "A is B" fail to learn "B is A"
    by: Berglund, Lukas, et al.
    Published: (2023)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar