A Grading Rubric for AI Safety Frameworks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Alaga, Jide, Schuett, Jonas, Anderljung, Markus |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Risk thresholds for frontier AI
par: Koessler, Leonie, et autres
Publié: (2024)
par: Koessler, Leonie, et autres
Publié: (2024)
On Regulating Downstream AI Developers
par: Williams, Sophie, et autres
Publié: (2025)
par: Williams, Sophie, et autres
Publié: (2025)
Safety cases for frontier AI
par: Buhl, Marie Davidsen, et autres
Publié: (2024)
par: Buhl, Marie Davidsen, et autres
Publié: (2024)
From Principles to Rules: A Regulatory Approach for Frontier AI
par: Schuett, Jonas, et autres
Publié: (2024)
par: Schuett, Jonas, et autres
Publié: (2024)
Defining the scope of AI regulations
par: Schuett, Jonas
Publié: (2019)
par: Schuett, Jonas
Publié: (2019)
Three lines of defense against risks from AI
par: Schuett, Jonas
Publié: (2022)
par: Schuett, Jonas
Publié: (2022)
Frontier AI developers need an internal audit function
par: Schuett, Jonas
Publié: (2023)
par: Schuett, Jonas
Publié: (2023)
Risk management in the Artificial Intelligence Act
par: Schuett, Jonas
Publié: (2022)
par: Schuett, Jonas
Publié: (2022)
STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports
par: McCaslin, Tegan, et autres
Publié: (2025)
par: McCaslin, Tegan, et autres
Publié: (2025)
From Turing to Tomorrow: The UK's Approach to AI Regulation
par: Ritchie, Oliver, et autres
Publié: (2025)
par: Ritchie, Oliver, et autres
Publié: (2025)
Safety case template for frontier AI: A cyber inability argument
par: Goemans, Arthur, et autres
Publié: (2024)
par: Goemans, Arthur, et autres
Publié: (2024)
Measuring AI R&D Automation
par: Chan, Alan, et autres
Publié: (2026)
par: Chan, Alan, et autres
Publié: (2026)
Societal Adaptation to Advanced AI
par: Bernardi, Jamie, et autres
Publié: (2024)
par: Bernardi, Jamie, et autres
Publié: (2024)
Towards interactive evaluations for interaction harms in human-AI systems
par: Ibrahim, Lujain, et autres
Publié: (2024)
par: Ibrahim, Lujain, et autres
Publié: (2024)
Responsible Reporting for Frontier AI Development
par: Kolt, Noam, et autres
Publié: (2024)
par: Kolt, Noam, et autres
Publié: (2024)
Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics
par: Johnson, Nari, et autres
Publié: (2026)
par: Johnson, Nari, et autres
Publié: (2026)
REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading
par: Zhao, Chengshuai, et autres
Publié: (2026)
par: Zhao, Chengshuai, et autres
Publié: (2026)
Visibility into AI Agents
par: Chan, Alan, et autres
Publié: (2024)
par: Chan, Alan, et autres
Publié: (2024)
Evaluating AI Providers' Frontier Safety Frameworks
par: Stelling, Lily, et autres
Publié: (2025)
par: Stelling, Lily, et autres
Publié: (2025)
Generative AI Feedback, English Writing and Teacher Rubrics: A Multiple-Case Study of CyberScholar
par: Zheldibayeva, Raigul, et autres
Publié: (2026)
par: Zheldibayeva, Raigul, et autres
Publié: (2026)
Institutional AI: A Governance Framework for Distributional AGI Safety
par: Pierucci, Federico, et autres
Publié: (2026)
par: Pierucci, Federico, et autres
Publié: (2026)
Frontier AI Auditing: Toward Rigorous Third-Party Assessment of Safety and Security Practices at Leading AI Companies
par: Brundage, Miles, et autres
Publié: (2026)
par: Brundage, Miles, et autres
Publié: (2026)
Third-party compliance reviews for frontier AI safety frameworks
par: Homewood, Aidan, et autres
Publié: (2025)
par: Homewood, Aidan, et autres
Publié: (2025)
Emerging Practices in Frontier AI Safety Frameworks
par: Buhl, Marie Davidsen, et autres
Publié: (2025)
par: Buhl, Marie Davidsen, et autres
Publié: (2025)
AI Safety Frameworks Should Include Procedures for Model Access Decisions
par: Kembery, Edward, et autres
Publié: (2024)
par: Kembery, Edward, et autres
Publié: (2024)
AI Safety for Everyone
par: Gyevnar, Balint, et autres
Publié: (2025)
par: Gyevnar, Balint, et autres
Publié: (2025)
The Role of AI Safety Institutes in Contributing to International Standards for Frontier AI Safety
par: Fort, Kristina
Publié: (2024)
par: Fort, Kristina
Publié: (2024)
Safety First: Psychological Safety as the Key to AI Transformation
par: Reich, Aaron, et autres
Publié: (2026)
par: Reich, Aaron, et autres
Publié: (2026)
How Should AI Safety Benchmarks Benchmark Safety?
par: Yu, Cheng, et autres
Publié: (2026)
par: Yu, Cheng, et autres
Publié: (2026)
Beyond the Rubric: Cultural Misalignment in LLM Benchmarks for Sexual and Reproductive Health
par: Dey, Sumon Kanti, et autres
Publié: (2025)
par: Dey, Sumon Kanti, et autres
Publié: (2025)
AI Safety, Alignment, and Ethics (AI SAE)
par: Waldner, Dylan
Publié: (2025)
par: Waldner, Dylan
Publié: (2025)
AI Safety is Stuck in Technical Terms -- A System Safety Response to the International AI Safety Report
par: Dobbe, Roel
Publié: (2025)
par: Dobbe, Roel
Publié: (2025)
PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning
par: Akyürek, Afra Feyza, et autres
Publié: (2025)
par: Akyürek, Afra Feyza, et autres
Publié: (2025)
Strategies for Creating Uncertainty in the AI Era to Trigger Students Critical Thinking: Pedagogical Design, Assessment Rubric, and Exam System
par: Wazan, Ahmad Samer
Publié: (2026)
par: Wazan, Ahmad Samer
Publié: (2026)
AI Safety in Generative AI Large Language Models: A Survey
par: Chua, Jaymari, et autres
Publié: (2024)
par: Chua, Jaymari, et autres
Publié: (2024)
RubRIX: Rubric-Driven Risk Mitigation in Caregiver-AI Interactions
par: Goel, Drishti, et autres
Publié: (2026)
par: Goel, Drishti, et autres
Publié: (2026)
Frontier AI developers need an internal audit function
par: Jonas Schuett
Publié: (2024)
par: Jonas Schuett
Publié: (2024)
AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries
par: Shu, Wesley, et autres
Publié: (2026)
par: Shu, Wesley, et autres
Publié: (2026)
The BIG Argument for AI Safety Cases
par: Habli, Ibrahim, et autres
Publié: (2025)
par: Habli, Ibrahim, et autres
Publié: (2025)
Persuasion and Safety in the Era of Generative AI
par: Kong, Haein
Publié: (2025)
par: Kong, Haein
Publié: (2025)
Documents similaires
-
Risk thresholds for frontier AI
par: Koessler, Leonie, et autres
Publié: (2024) -
On Regulating Downstream AI Developers
par: Williams, Sophie, et autres
Publié: (2025) -
Safety cases for frontier AI
par: Buhl, Marie Davidsen, et autres
Publié: (2024) -
From Principles to Rules: A Regulatory Approach for Frontier AI
par: Schuett, Jonas, et autres
Publié: (2024) -
Defining the scope of AI regulations
par: Schuett, Jonas
Publié: (2019)