Aller au contenu
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Connexion
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Recherche avancée
  • Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
Image de couverture de livre

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Korbak, Tomek, Balesni, Mikita, Barnes, Elizabeth, Bengio, Yoshua, Benton, Joe, Bloom, Joseph, Chen, Mark, Cooney, Alan, Dafoe, Allan, Dragan, Anca, Emmons, Scott, Evans, Owain, Farhi, David, Greenblatt, Ryan, Hendrycks, Dan, Hobbhahn, Marius, Hubinger, Evan, Irving, Geoffrey, Jenner, Erik, Kokotajlo, Daniel, Krakovna, Victoria, Legg, Shane, Lindner, David, Luan, David, Mądry, Aleksander, Michael, Julian, Nanda, Neel, Orr, Dave, Pachocki, Jakub, Perez, Ethan, Phuong, Mary, Roger, Fabien, Saxe, Joshua, Shlegeris, Buck, Soto, Martín, Steinberger, Eric, Wang, Jasmine, Zaremba, Wojciech, Baker, Bowen, Shah, Rohin, Mikulik, Vlad
Format: Preprint
Publié: 2025
Sujets:
Artificial Intelligence
Machine Learning
Accès en ligne:
Acceder al recurso
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
  • Citer
  • Envoyer par SMS
  • Envoyer par courriel
  • Imprimer
  • Exporter les notices
    • Exporter vers RefWorks
    • Exporter vers EndNoteWeb
    • Exporter vers EndNote
  • Ajouter aux favoris
  • Permalien
  • Exemplaires
  • Description
  • Commentaires
  • Documents similaires
  • Affichage MARC

Internet

https://arxiv.org/abs/2507.11473

Documents similaires

  • Lessons from Studying Two-Hop Latent Reasoning
    par: Balesni, Mikita, et autres
    Publié: (2024)
  • How to evaluate control measures for LLM agents? A trajectory from today to superintelligence
    par: Korbak, Tomek, et autres
    Publié: (2025)
  • Towards evaluations-based safety cases for AI scheming
    par: Balesni, Mikita, et autres
    Publié: (2024)
  • Large Language Models can Strategically Deceive their Users when Put Under Pressure
    par: Scheurer, Jérémy, et autres
    Publié: (2023)
  • The Reversal Curse: LLMs trained on "A is B" fail to learn "B is A"
    par: Berglund, Lukas, et autres
    Publié: (2023)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar