The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Dombrowski, Ann-Kathrin, Bowen, Dillon, Gleave, Adam, Cundy, Chris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
di: Bowen, Dillon, et al.
Pubblicazione: (2025)
A Human-In-The-Loop Approach for Improving Fairness in Predictive Business Process Monitoring
di: Käppel, Martin, et al.
Pubblicazione: (2025)
di: Käppel, Martin, et al.
Pubblicazione: (2025)
Trajectory-Aware Reliability Modeling of Democratic Systems
di: Zaytsev, Dmitry, et al.
Pubblicazione: (2026)
di: Zaytsev, Dmitry, et al.
Pubblicazione: (2026)
A Generalization Bound for a Family of Implicit Networks
di: Fung, Samy Wu, et al.
Pubblicazione: (2024)
di: Fung, Samy Wu, et al.
Pubblicazione: (2024)
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
di: Pavlov, Gorgi
Pubblicazione: (2026)
di: Pavlov, Gorgi
Pubblicazione: (2026)
Preference Learning with Lie Detectors can Induce Honesty or Evasion
di: Cundy, Chris, et al.
Pubblicazione: (2025)
di: Cundy, Chris, et al.
Pubblicazione: (2025)
On the Sample Complexity of One Hidden Layer Networks with Equivariance, Locality and Weight Sharing
di: Behboodi, Arash, et al.
Pubblicazione: (2024)
di: Behboodi, Arash, et al.
Pubblicazione: (2024)
Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach
di: Liu, Linyu, et al.
Pubblicazione: (2024)
di: Liu, Linyu, et al.
Pubblicazione: (2024)
Optimizing MoE Routers: Design, Implementation, and Evaluation in Transformer Models
di: Harvey, Daniel Fidel, et al.
Pubblicazione: (2025)
di: Harvey, Daniel Fidel, et al.
Pubblicazione: (2025)
Improving Fairness and Mitigating MADness in Generative Models
di: Mayer, Paul, et al.
Pubblicazione: (2024)
di: Mayer, Paul, et al.
Pubblicazione: (2024)
Tadpole: Autoencoders as Foundation Models for 3D PDEs with Online Learning
di: Liu, Qiang, et al.
Pubblicazione: (2026)
di: Liu, Qiang, et al.
Pubblicazione: (2026)
Two-Stage Generative Model for Intracranial Aneurysm Meshes with Morphological Marker Conditioning
di: Ding, Wenhao, et al.
Pubblicazione: (2025)
di: Ding, Wenhao, et al.
Pubblicazione: (2025)
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
di: Yamchote, Phaphontee, et al.
Pubblicazione: (2025)
di: Yamchote, Phaphontee, et al.
Pubblicazione: (2025)
Wave-Attractor-Tree: A Hierarchical Binary Tree Reduction Architecture for Efficient Sequence Modeling
di: Berezkin, Igor
Pubblicazione: (2026)
di: Berezkin, Igor
Pubblicazione: (2026)
Beyond the Class Subspace: Teacher-Guided Training for Reliable Out-of-Distribution Detection in Single-Domain Models
di: Yang, Hong, et al.
Pubblicazione: (2026)
di: Yang, Hong, et al.
Pubblicazione: (2026)
Nonlinear GENERIC Informed Neural Networks (N-GINNs): learning GENERIC dynamics with non-quadratic dissipation potentials
di: Votruba, Vojtěch, et al.
Pubblicazione: (2026)
di: Votruba, Vojtěch, et al.
Pubblicazione: (2026)
Attention to Mamba: A Recipe for Cross-Architecture Distillation
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
di: Moudgil, Abhinav, et al.
Pubblicazione: (2026)
Feature Selection with Annealing for Forecasting Financial Time Series
di: Pabuccu, Hakan, et al.
Pubblicazione: (2023)
di: Pabuccu, Hakan, et al.
Pubblicazione: (2023)
The Inhibitor: ReLU and Addition-Based Attention for Efficient Transformers under Fully Homomorphic Encryption on the Torus
di: Brännvall, Rickard, et al.
Pubblicazione: (2023)
di: Brännvall, Rickard, et al.
Pubblicazione: (2023)
A Language Model-Driven Semi-Supervised Ensemble Framework for Illicit Market Detection Across Deep/Dark Web and Social Platforms
di: Yazdanjue, Navid, et al.
Pubblicazione: (2025)
di: Yazdanjue, Navid, et al.
Pubblicazione: (2025)
The Boundaries of Verifiable Accuracy, Robustness, and Generalisation in Deep Learning
di: Bastounis, Alexander, et al.
Pubblicazione: (2023)
di: Bastounis, Alexander, et al.
Pubblicazione: (2023)
Graph-Conditional Flow Matching for Relational Data Generation
di: Scassola, Davide, et al.
Pubblicazione: (2025)
di: Scassola, Davide, et al.
Pubblicazione: (2025)
Feature Learning Beyond the Edge of Stability
di: Terjék, Dávid
Pubblicazione: (2025)
di: Terjék, Dávid
Pubblicazione: (2025)
Optimizing Basis Function Selection in Constructive Wavelet Neural Networks and Its Applications
di: Huang, Dunsheng, et al.
Pubblicazione: (2025)
di: Huang, Dunsheng, et al.
Pubblicazione: (2025)
A Teacher-Student Perspective on the Dynamics of Learning Near the Optimal Point
di: Couto, Carlos, et al.
Pubblicazione: (2025)
di: Couto, Carlos, et al.
Pubblicazione: (2025)
Closed-Form Feedback-Free Learning with Forward Projection
di: O'Shea, Robert, et al.
Pubblicazione: (2025)
di: O'Shea, Robert, et al.
Pubblicazione: (2025)
Markov Chain Estimation with In-Context Learning
di: Lepage, Simon, et al.
Pubblicazione: (2025)
di: Lepage, Simon, et al.
Pubblicazione: (2025)
Structured Knowledge Accumulation: The Principle of Entropic Least Action in Forward-Only Neural Learning
di: Quantiota, Bouarfa Mahi
Pubblicazione: (2025)
di: Quantiota, Bouarfa Mahi
Pubblicazione: (2025)
Iterative Orthogonalization Scaling Laws
di: Selvaraj, Devan
Pubblicazione: (2025)
di: Selvaraj, Devan
Pubblicazione: (2025)
MLPs at the EOC: Spectrum of the NTK
di: Terjék, Dávid, et al.
Pubblicazione: (2025)
di: Terjék, Dávid, et al.
Pubblicazione: (2025)
Segmentation of cracks in 3d images of fiber reinforced concrete using deep learning
di: Nowacka, Anna, et al.
Pubblicazione: (2025)
di: Nowacka, Anna, et al.
Pubblicazione: (2025)
Deep generative models as the probability transformation functions
di: Bondar, Vitalii, et al.
Pubblicazione: (2025)
di: Bondar, Vitalii, et al.
Pubblicazione: (2025)
MLPs at the EOC: Concentration of the NTK
di: Terjék, Dávid, et al.
Pubblicazione: (2025)
di: Terjék, Dávid, et al.
Pubblicazione: (2025)
ConFIG: Towards Conflict-free Training of Physics Informed Neural Networks
di: Liu, Qiang, et al.
Pubblicazione: (2024)
di: Liu, Qiang, et al.
Pubblicazione: (2024)
A Comprehensive View of Personalized Federated Learning on Heterogeneous Clinical Datasets
di: Tavakoli, Fatemeh, et al.
Pubblicazione: (2023)
di: Tavakoli, Fatemeh, et al.
Pubblicazione: (2023)
Deep Learning and Transfer Learning Architectures for English Premier League Player Performance Forecasting
di: Frees, Daniel, et al.
Pubblicazione: (2024)
di: Frees, Daniel, et al.
Pubblicazione: (2024)
Flow matching on homogeneous spaces
di: Ruscelli, Francesco
Pubblicazione: (2026)
di: Ruscelli, Francesco
Pubblicazione: (2026)
Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization
di: Qin, Zhou, et al.
Pubblicazione: (2024)
di: Qin, Zhou, et al.
Pubblicazione: (2024)
Stability Analysis of Equivariant Convolutional Representations Through The Lens of Equivariant Multi-layered CKNs
di: Chowdhury, Soutrik Roy
Pubblicazione: (2024)
di: Chowdhury, Soutrik Roy
Pubblicazione: (2024)
Training-Free Generative Sampling via Moment-Matched Score Smoothing
di: Yao, Zhenyu, et al.
Pubblicazione: (2026)
di: Yao, Zhenyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations
di: Bowen, Dillon, et al.
Pubblicazione: (2025) -
A Human-In-The-Loop Approach for Improving Fairness in Predictive Business Process Monitoring
di: Käppel, Martin, et al.
Pubblicazione: (2025) -
Trajectory-Aware Reliability Modeling of Democratic Systems
di: Zaytsev, Dmitry, et al.
Pubblicazione: (2026) -
A Generalization Bound for a Family of Implicit Networks
di: Fung, Samy Wu, et al.
Pubblicazione: (2024) -
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
di: Pavlov, Gorgi
Pubblicazione: (2026)