Evaluating Frontier Models for Dangerous Capabilities
Fuente:
arXiv
Salvato in:
| Autori principali: | Phuong, Mary, Aitchison, Matthew, Catt, Elliot, Cogan, Sarah, Kaskasoli, Alexandre, Krakovna, Victoria, Lindner, David, Rahtz, Matthew, Assael, Yannis, Hodkinson, Sarah, Howard, Heidi, Lieberum, Tom, Kumar, Ramana, Raad, Maria Abi, Webson, Albert, Ho, Lewis, Lin, Sharon, Farquhar, Sebastian, Hutter, Marcus, Deletang, Gregoire, Ruoss, Anian, El-Sayed, Seliem, Brown, Sasha, Dragan, Anca, Shah, Rohin, Dafoe, Allan, Shevlane, Toby |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distributional Bellman Operators over Mean Embeddings
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2023)
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2023)
Learning Universal Predictors
di: Grau-Moya, Jordi, et al.
Pubblicazione: (2024)
di: Grau-Moya, Jordi, et al.
Pubblicazione: (2024)
Language Modeling Is Compression
di: Delétang, Grégoire, et al.
Pubblicazione: (2023)
di: Delétang, Grégoire, et al.
Pubblicazione: (2023)
Evaluating Frontier Models for Stealth and Situational Awareness
di: Phuong, Mary, et al.
Pubblicazione: (2025)
di: Phuong, Mary, et al.
Pubblicazione: (2025)
Realistic honeypot evaluations for scheming propensity
di: Krakovna, Victoria, et al.
Pubblicazione: (2026)
di: Krakovna, Victoria, et al.
Pubblicazione: (2026)
Amortized Planning with Large-Scale Transformers: A Case Study on Chess
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
Gram: Assessing sabotage propensities via automated alignment auditing
di: Lindner, David, et al.
Pubblicazione: (2026)
di: Lindner, David, et al.
Pubblicazione: (2026)
Compression via Pre-trained Transformers: A Study on Byte-Level Multimodal Data
di: Heurtel-Depeiges, David, et al.
Pubblicazione: (2024)
di: Heurtel-Depeiges, David, et al.
Pubblicazione: (2024)
Why is prompting hard? Understanding prompts on binary sequence predictors
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2025)
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2025)
LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
di: Ruoss, Anian, et al.
Pubblicazione: (2024)
AtP*: An efficient and scalable method for localizing LLM behaviour to components
di: Kramár, János, et al.
Pubblicazione: (2024)
di: Kramár, János, et al.
Pubblicazione: (2024)
Understanding Prompt Tuning and In-Context Learning via Meta-Learning
di: Genewein, Tim, et al.
Pubblicazione: (2025)
di: Genewein, Tim, et al.
Pubblicazione: (2025)
Masculinity and Danger on the Eighteenth-Century Grand Tour
di: Goldsmith, Sarah
Pubblicazione: (2021)
di: Goldsmith, Sarah
Pubblicazione: (2021)
A Dangerous Occupation? Violence in Public Libraries.
di: Farrugia, Sarah
Pubblicazione: (2002)
di: Farrugia, Sarah
Pubblicazione: (2002)
Auf Pump
di: Ruoss, Matthias
Pubblicazione: (2025)
di: Ruoss, Matthias
Pubblicazione: (2025)
Schweizerdeutsch und Sprachbewusstsein
di: Ruoss, Emanuel
Pubblicazione: (2020)
di: Ruoss, Emanuel
Pubblicazione: (2020)
El pensamiento de la CEPAL : un intento de evaluar algunas críticas a sus ideas principales / Héctor Assael
di: Assael, Héctor
Pubblicazione: (1981)
di: Assael, Héctor
Pubblicazione: (1981)
El mito del subterráneo: memoria, política y participación en un liceo secundario de Santiago
di: Jenny Assaél
Pubblicazione: (2001)
di: Jenny Assaél
Pubblicazione: (2001)
Les Mysteres de L’onomastique Dans L’helene D’euripide
di: Jacqueline Assaël
Pubblicazione: (2014)
di: Jacqueline Assaël
Pubblicazione: (2014)
Estandarización educativa en Chile: tensiones y consecuencias para el trabajo docente
di: Jenny Assaél
Pubblicazione: (2018)
di: Jenny Assaél
Pubblicazione: (2018)
An Information-Theoretic Diagnostic Analytics Framework for Mapping Past-Future Dependence in Horizon-Specific Forecastability
di: Catt, Peter Maurice
Pubblicazione: (2026)
di: Catt, Peter Maurice
Pubblicazione: (2026)
Forecastability as an Information-Theoretic Limit on Prediction
di: Catt, Peter Maurice
Pubblicazione: (2026)
di: Catt, Peter Maurice
Pubblicazione: (2026)
On the Limits of Prediction: Forecastability Profiles and Information Decay in Time Series
di: Catt, Peter Maurice
Pubblicazione: (2026)
di: Catt, Peter Maurice
Pubblicazione: (2026)
The Olympic Training Field for Planning Quality Library Services.
di: Catt, Martha E.
Pubblicazione: (1995)
di: Catt, Martha E.
Pubblicazione: (1995)
Navigating the Political Dangers of Critical Approaches to Sexual Violence Work
di: Sarah Socorro Hurtado
Pubblicazione: (2024)
di: Sarah Socorro Hurtado
Pubblicazione: (2024)
Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
di: Lieberum, Tom, et al.
Pubblicazione: (2024)
Acerca del lugar de la entrevista en encuestas electorales
di: Assael Ortiz Lazcano
Pubblicazione: (2006)
di: Assael Ortiz Lazcano
Pubblicazione: (2006)
La empresa educativa Chilena
di: Jenny Assaél Budnik
Pubblicazione: (2011)
di: Jenny Assaél Budnik
Pubblicazione: (2011)
A Mechanism-Based Approach to Mitigating Harms from Persuasive Generative AI
di: El-Sayed, Seliem, et al.
Pubblicazione: (2024)
di: El-Sayed, Seliem, et al.
Pubblicazione: (2024)
MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking
di: Farquhar, Sebastian, et al.
Pubblicazione: (2025)
di: Farquhar, Sebastian, et al.
Pubblicazione: (2025)
Canonicity in power and modal logics of finite achronal width
di: Goldblatt, Robert, et al.
Pubblicazione: (2022)
di: Goldblatt, Robert, et al.
Pubblicazione: (2022)
Comprehensive AI governance requires addressing non-model gains
di: Goemans, Arthur, et al.
Pubblicazione: (2026)
di: Goemans, Arthur, et al.
Pubblicazione: (2026)
Groups with ET0L co-word problem
di: Kohli, Raad Al, et al.
Pubblicazione: (2024)
di: Kohli, Raad Al, et al.
Pubblicazione: (2024)
Cross-Cohort Calibration of Conformal Prediction for Lesion-Level SUV Quantification in Theranostic PET — Analysis Code
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
hayden-farquhar/NNDSS-Gonorrhoea-AMR: v1.0.1 — README updated with all-versions Zenodo DOI
di: Hayden Farquhar
Pubblicazione: (2026)
di: Hayden Farquhar
Pubblicazione: (2026)
Analysis code for: Paper Mill Subtypes in Medical AI: Multi-Signal NLP Detection Reveals Heterogeneous Fraud Fingerprints
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
Real-World Safety Profile of Xanomeline-Trospium (Cobenfy), the First Muscarinic Agonist Antipsychotic: A Disproportionality Analysis of the FDA Adverse Event Reporting System
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
hayden-farquhar/Rare-Disease-RAG: v2.0 — Revised manuscript (ablation and error analysis)
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
Large Language Models for Population-Level Public Health Communication: A Scoping Review
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
Age Dominates Machine Learning Survival Prediction in Haematological Malignancies: A Multi-Disease Analysis of 192,825 Patients Demonstrates Cox Regression Sufficiency
di: Farquhar, Hayden
Pubblicazione: (2026)
di: Farquhar, Hayden
Pubblicazione: (2026)
Documenti analoghi
-
Distributional Bellman Operators over Mean Embeddings
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2023) -
Learning Universal Predictors
di: Grau-Moya, Jordi, et al.
Pubblicazione: (2024) -
Language Modeling Is Compression
di: Delétang, Grégoire, et al.
Pubblicazione: (2023) -
Evaluating Frontier Models for Stealth and Situational Awareness
di: Phuong, Mary, et al.
Pubblicazione: (2025) -
Realistic honeypot evaluations for scheming propensity
di: Krakovna, Victoria, et al.
Pubblicazione: (2026)