The science and practice of proportionality in AI risk evaluations
Fuente:
arXiv
Salvato in:
| Autori principali: | Mougan, Carlos, Morlock, Lauritz, Aguirre, Jair, Black, James R. M., Brauner, Jan, Campos, Simeon, Dev, Sunishchal, Llorca, David Fernández, Franzin, Alberto, Fritz, Mario, Gómez, Emilia, Grosse-Holz, Friederike, Hamilton, Eloise, Hasin, Max, Hernandez-Orallo, Jose, Lahav, Dan, Massarelli, Luca, Mavroudis, Vasilios, Murray, Malcolm, Paskov, Patricia, Raldua, Jaime, Schellaert, Wout |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-Trust Network Access (ZTNA)
di: Mavroudis, Vasilios
Pubblicazione: (2024)
di: Mavroudis, Vasilios
Pubblicazione: (2024)
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
di: Ristea, Dan, et al.
Pubblicazione: (2024)
di: Ristea, Dan, et al.
Pubblicazione: (2024)
Analysis of Publicly Accessible Operational Technology and Associated Risks
di: Rodda, Matthew, et al.
Pubblicazione: (2025)
di: Rodda, Matthew, et al.
Pubblicazione: (2025)
Quantifying Mix Network Privacy Erosion with Generative Models
di: Mavroudis, Vasilios, et al.
Pubblicazione: (2025)
di: Mavroudis, Vasilios, et al.
Pubblicazione: (2025)
Referential Security as a New Paradigm for AI Evaluations
di: Ristea, Dan, et al.
Pubblicazione: (2026)
di: Ristea, Dan, et al.
Pubblicazione: (2026)
PredictaBoard: Benchmarking LLM Score Predictability
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2025)
di: Pacchiardi, Lorenzo, et al.
Pubblicazione: (2025)
On Efficient Bayesian Exploration in Model-Based Reinforcement Learning
di: Caron, Alberto, et al.
Pubblicazione: (2025)
di: Caron, Alberto, et al.
Pubblicazione: (2025)
Towards Causal Model-Based Policy Optimization
di: Caron, Alberto, et al.
Pubblicazione: (2025)
di: Caron, Alberto, et al.
Pubblicazione: (2025)
A View on Out-of-Distribution Identification from a Statistical Testing Theory Perspective
di: Caron, Alberto, et al.
Pubblicazione: (2024)
di: Caron, Alberto, et al.
Pubblicazione: (2024)
Nearest Neighbour with Bandit Feedback
di: Pasteris, Stephen, et al.
Pubblicazione: (2023)
di: Pasteris, Stephen, et al.
Pubblicazione: (2023)
Mitigating Deep Reinforcement Learning Backdoors in the Neural Activation Space
di: Vyas, Sanyam, et al.
Pubblicazione: (2024)
di: Vyas, Sanyam, et al.
Pubblicazione: (2024)
Beyond Rewards in Reinforcement Learning for Cyber Defence
di: Bates, Elizabeth, et al.
Pubblicazione: (2026)
di: Bates, Elizabeth, et al.
Pubblicazione: (2026)
Fairness with Exponential Weights
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
Less is more? Rewards in RL for Cyber Defence
di: Bates, Elizabeth, et al.
Pubblicazione: (2025)
di: Bates, Elizabeth, et al.
Pubblicazione: (2025)
Extraction Propagation
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
Model Monitoring in the Absence of Labeled Data via Feature Attributions Distributions
di: Mougan, Carlos
Pubblicazione: (2025)
di: Mougan, Carlos
Pubblicazione: (2025)
Environment Complexity and Nash Equilibria in a Sequential Social Dilemma
di: Yasir, Mustafa, et al.
Pubblicazione: (2024)
di: Yasir, Mustafa, et al.
Pubblicazione: (2024)
Autonomous Network Defence using Reinforcement Learning
di: Foley, Myles, et al.
Pubblicazione: (2024)
di: Foley, Myles, et al.
Pubblicazione: (2024)
Online Convex Optimisation: The Optimal Switching Regret for all Segmentations Simultaneously
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
di: Pasteris, Stephen, et al.
Pubblicazione: (2024)
Inherently Interpretable and Uncertainty-Aware Models for Online Learning in Cyber-Security Problems
di: Kolicic, Benjamin, et al.
Pubblicazione: (2024)
di: Kolicic, Benjamin, et al.
Pubblicazione: (2024)
CybORG++: An Enhanced Gym for the Development of Autonomous Cyber Agents
di: Emerson, Harry, et al.
Pubblicazione: (2024)
di: Emerson, Harry, et al.
Pubblicazione: (2024)
Mini boson stars in higher dimensions are radially unstable
di: Franzin, Edgardo
Pubblicazione: (2024)
di: Franzin, Edgardo
Pubblicazione: (2024)
Entity-based Reinforcement Learning for Autonomous Cyber Defence
di: Thompson, Isaac Symes, et al.
Pubblicazione: (2024)
di: Thompson, Isaac Symes, et al.
Pubblicazione: (2024)
Recommendations and Reporting Checklist for Rigorous & Transparent Human Baselines in Model Evaluations
di: Wei, Kevin L., et al.
Pubblicazione: (2025)
di: Wei, Kevin L., et al.
Pubblicazione: (2025)
COMPARACIÓN INTERNACIONAL DE LOS EMPLEOS DEL TIEMPO DE MUJERES Y HOMBRES
di: Eduardo V. Raldúa Martín
Pubblicazione: (2001)
di: Eduardo V. Raldúa Martín
Pubblicazione: (2001)
Kantian Deontology Meets AI Alignment: Towards Morally Grounded Fairness Metrics
di: Mougan, Carlos, et al.
Pubblicazione: (2023)
di: Mougan, Carlos, et al.
Pubblicazione: (2023)
Anytime-valid simultaneous lower confidence bounds for the true discovery proportion
di: Preusse, Friederike
Pubblicazione: (2025)
di: Preusse, Friederike
Pubblicazione: (2025)
What if we could hot swap our Biometrics?
di: Crowcroft, Jon, et al.
Pubblicazione: (2025)
di: Crowcroft, Jon, et al.
Pubblicazione: (2025)
An Attentive Graph Agent for Topology-Adaptive Cyber Defence
di: Sandoval, Ilya Orson, et al.
Pubblicazione: (2025)
di: Sandoval, Ilya Orson, et al.
Pubblicazione: (2025)
Beyond Training-time Poisoning: Component-level and Post-training Backdoors in Deep Reinforcement Learning
di: Vyas, Sanyam, et al.
Pubblicazione: (2025)
di: Vyas, Sanyam, et al.
Pubblicazione: (2025)
Formação de professores de Ciências Biológicas e a preocupação com as necessidades específicas na sala de aula
di: Simone Medianeira Franzin
Pubblicazione: (2015)
di: Simone Medianeira Franzin
Pubblicazione: (2015)
Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
di: Souly, Alexandra, et al.
Pubblicazione: (2025)
di: Souly, Alexandra, et al.
Pubblicazione: (2025)
Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
di: Egbuna, Nathan, et al.
Pubblicazione: (2025)
di: Egbuna, Nathan, et al.
Pubblicazione: (2025)
Sumudu Neural Operator for ODEs and PDEs
di: Zelenskiy, Ben, et al.
Pubblicazione: (2025)
di: Zelenskiy, Ben, et al.
Pubblicazione: (2025)
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
di: Dev, Sunishchal, et al.
Pubblicazione: (2026)
di: Dev, Sunishchal, et al.
Pubblicazione: (2026)
Solving Large‐Scale Weapon Target Assignment Problems in Seconds Using Branch‐Price‐And‐Cut
di: Dimitris Bertsimas, et al.
Pubblicazione: (2025)
di: Dimitris Bertsimas, et al.
Pubblicazione: (2025)
Unveiling Voices: A Co-Hashtag Analysis of TikTok Discourse on the 2023 Israel-Palestine Crisis
di: Hasin, Rozin
Pubblicazione: (2025)
di: Hasin, Rozin
Pubblicazione: (2025)
Prosthetics of the Indian State: The e-Shram Portal for Unorganized Workers in India
di: Hasin, Rozin
Pubblicazione: (2025)
di: Hasin, Rozin
Pubblicazione: (2025)
Non‐target Screening nach bioaktiven und gefährdenden Bestandteilen aus komplexen Matrices mittels multidimensionaler Techniken
di: Tamara Schreiner, et al.
Pubblicazione: (2024)
di: Tamara Schreiner, et al.
Pubblicazione: (2024)
Non‐target Analytik von CBD‐Ölen mit planaren Bioassays
di: A. Haase, et al.
Pubblicazione: (2026)
di: A. Haase, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Zero-Trust Network Access (ZTNA)
di: Mavroudis, Vasilios
Pubblicazione: (2024) -
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
di: Ristea, Dan, et al.
Pubblicazione: (2024) -
Analysis of Publicly Accessible Operational Technology and Associated Risks
di: Rodda, Matthew, et al.
Pubblicazione: (2025) -
Quantifying Mix Network Privacy Erosion with Generative Models
di: Mavroudis, Vasilios, et al.
Pubblicazione: (2025) -
Referential Security as a New Paradigm for AI Evaluations
di: Ristea, Dan, et al.
Pubblicazione: (2026)