AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance
Fuente:
arXiv
Salvato in:
| Autore principale: | Solanke, Abiodun A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context
di: Zhang, Zhihao, et al.
Pubblicazione: (2026)
di: Zhang, Zhihao, et al.
Pubblicazione: (2026)
GovRelBench:A Benchmark for Government Domain Relevance
di: Wang, Haiquan, et al.
Pubblicazione: (2025)
di: Wang, Haiquan, et al.
Pubblicazione: (2025)
PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation
di: Hang, Zhen, et al.
Pubblicazione: (2026)
di: Hang, Zhen, et al.
Pubblicazione: (2026)
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
di: Zhao, Haochen, et al.
Pubblicazione: (2024)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
di: Zhang, Wenjing, et al.
Pubblicazione: (2024)
EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems
di: Qin, Xue, et al.
Pubblicazione: (2026)
di: Qin, Xue, et al.
Pubblicazione: (2026)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
Unsteady Metrics and Benchmarking Cultures of AI Model Builders
di: Baack, Stefan, et al.
Pubblicazione: (2026)
di: Baack, Stefan, et al.
Pubblicazione: (2026)
ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents
di: Levy, Ido, et al.
Pubblicazione: (2024)
di: Levy, Ido, et al.
Pubblicazione: (2024)
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
di: Ren, Richard, et al.
Pubblicazione: (2024)
di: Ren, Richard, et al.
Pubblicazione: (2024)
FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning
di: Mao, Mingyang, et al.
Pubblicazione: (2026)
di: Mao, Mingyang, et al.
Pubblicazione: (2026)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
di: Shi, Wentao, et al.
Pubblicazione: (2026)
di: Shi, Wentao, et al.
Pubblicazione: (2026)
LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning
di: Agarwal, Shradha, et al.
Pubblicazione: (2026)
di: Agarwal, Shradha, et al.
Pubblicazione: (2026)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
di: Choi, Dasol, et al.
Pubblicazione: (2026)
di: Choi, Dasol, et al.
Pubblicazione: (2026)
CI-Bench: Benchmarking Contextual Integrity of AI Assistants on Synthetic Data
di: Cheng, Zhao, et al.
Pubblicazione: (2024)
di: Cheng, Zhao, et al.
Pubblicazione: (2024)
AIReg-Bench: Benchmarking Language Models That Assess AI Regulation Compliance
di: Marino, Bill, et al.
Pubblicazione: (2025)
di: Marino, Bill, et al.
Pubblicazione: (2025)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
di: Liu, Chenxu, et al.
Pubblicazione: (2026)
Riemann-Bench: A Benchmark for Moonshot Mathematics
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
di: Zong, Xuanjun, et al.
Pubblicazione: (2025)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
PBT-Bench: Benchmarking AI Agents on Property-Based Testing
di: Jing, Lucas, et al.
Pubblicazione: (2026)
di: Jing, Lucas, et al.
Pubblicazione: (2026)
EmboCoach-Bench: Benchmarking AI Agents on Developing Embodied Robots
di: Lei, Zixing, et al.
Pubblicazione: (2026)
di: Lei, Zixing, et al.
Pubblicazione: (2026)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
di: Xiong, Lei, et al.
Pubblicazione: (2026)
di: Xiong, Lei, et al.
Pubblicazione: (2026)
HW-GPT-Bench: Hardware-Aware Architecture Benchmark for Language Models
di: Sukthanker, Rhea Sanjay, et al.
Pubblicazione: (2024)
di: Sukthanker, Rhea Sanjay, et al.
Pubblicazione: (2024)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
di: Liu, Zhou, et al.
Pubblicazione: (2025)
di: Liu, Zhou, et al.
Pubblicazione: (2025)
Can We Trust AI to Govern AI? Benchmarking LLM Performance on Privacy and AI Governance Exams
di: Witherspoon, Zane, et al.
Pubblicazione: (2025)
di: Witherspoon, Zane, et al.
Pubblicazione: (2025)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
di: Karger, Ezra, et al.
Pubblicazione: (2024)
di: Karger, Ezra, et al.
Pubblicazione: (2024)
AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies
di: Zeng, Yi, et al.
Pubblicazione: (2024)
di: Zeng, Yi, et al.
Pubblicazione: (2024)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
di: Li, Miles Q., et al.
Pubblicazione: (2026)
di: Li, Miles Q., et al.
Pubblicazione: (2026)
DCA-Bench: A Benchmark for Dataset Curation Agents
di: Huang, Benhao, et al.
Pubblicazione: (2024)
di: Huang, Benhao, et al.
Pubblicazione: (2024)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
di: Yuan, Tongxin, et al.
Pubblicazione: (2024)
di: Yuan, Tongxin, et al.
Pubblicazione: (2024)
ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities
di: Zanoli, Christopher, et al.
Pubblicazione: (2026)
di: Zanoli, Christopher, et al.
Pubblicazione: (2026)
ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines
di: Jin, Tengjun, et al.
Pubblicazione: (2025)
di: Jin, Tengjun, et al.
Pubblicazione: (2025)
HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation
di: Chen, Qirui, et al.
Pubblicazione: (2026)
di: Chen, Qirui, et al.
Pubblicazione: (2026)
CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models
di: Sun, Guangzhi, et al.
Pubblicazione: (2025)
di: Sun, Guangzhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
di: Zhang, Zhexin, et al.
Pubblicazione: (2025) -
Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context
di: Zhang, Zhihao, et al.
Pubblicazione: (2026) -
GovRelBench:A Benchmark for Government Domain Relevance
di: Wang, Haiquan, et al.
Pubblicazione: (2025) -
PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation
di: Hang, Zhen, et al.
Pubblicazione: (2026) -
CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs
di: Liu, Yuxuan, et al.
Pubblicazione: (2026)