CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bhatt, Manish, Chennabasappa, Sahana, Li, Yue, Nikolaidis, Cyrus, Song, Daniel, Wan, Shengye, Ahmad, Faizan, Aschermann, Cornelius, Chen, Yaohui, Kapil, Dhaval, Molnar, David, Whitman, Spencer, Saxe, Joshua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
par: Wan, Shengye, et autres
Publié: (2024)
par: Wan, Shengye, et autres
Publié: (2024)
Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique
par: Hariharan, Suhas, et autres
Publié: (2024)
par: Hariharan, Suhas, et autres
Publié: (2024)
Bridging the Gap: A Study of AI-based Vulnerability Management between Industry and Academia
par: Wan, Shengye, et autres
Publié: (2024)
par: Wan, Shengye, et autres
Publié: (2024)
LlamaFirewall: An open source guardrail system for building secure AI agents
par: Chennabasappa, Sahana, et autres
Publié: (2025)
par: Chennabasappa, Sahana, et autres
Publié: (2025)
CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning
par: Deason, Lauren, et autres
Publié: (2025)
par: Deason, Lauren, et autres
Publié: (2025)
Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models
par: Bhatt, Manish
Publié: (2026)
par: Bhatt, Manish
Publié: (2026)
Bhatt Conjectures: On Necessary-But-Not-Sufficient Benchmark Tautology for Human Like Reasoning
par: Bhatt, Manish
Publié: (2025)
par: Bhatt, Manish
Publié: (2025)
Towards Automated Generation of Smart Grid Cyber Range for Cybersecurity Experiments and Training
par: Mashima, Daisuke, et autres
Publié: (2024)
par: Mashima, Daisuke, et autres
Publié: (2024)
SuiteEval: Simplifying Retrieval Benchmarks
par: Parry, Andrew, et autres
Publié: (2026)
par: Parry, Andrew, et autres
Publié: (2026)
Cyber-Forensic Review of Human Footprint and Gait for Personal Identification
par: Nagwanshi, Kapil Kumar
Publié: (2022)
par: Nagwanshi, Kapil Kumar
Publié: (2022)
SecMate: Multi-Agent Adaptive Cybersecurity Troubleshooting with Tri-Context Personalization
par: Meidan, Yair, et autres
Publié: (2026)
par: Meidan, Yair, et autres
Publié: (2026)
NetSecBed: A Container-Native Testbed for Reproducible Cybersecurity Experimentation
par: Bitzki, Leonardo, et autres
Publié: (2026)
par: Bitzki, Leonardo, et autres
Publié: (2026)
SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
par: Jing, Pengfei, et autres
Publié: (2024)
par: Jing, Pengfei, et autres
Publié: (2024)
SCORPION Cyber Range: Fully Customizable Cyberexercises, Gamification, and Learning Analytics to Train Cybersecurity Competencies
par: Nespoli, Pantaleone, et autres
Publié: (2024)
par: Nespoli, Pantaleone, et autres
Publié: (2024)
Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps
par: Chona, Alankrit, et autres
Publié: (2026)
par: Chona, Alankrit, et autres
Publié: (2026)
SecVulEval: Benchmarking LLMs for Real-World C/C++ Vulnerability Detection
par: Ahmed, Md Basim Uddin, et autres
Publié: (2025)
par: Ahmed, Md Basim Uddin, et autres
Publié: (2025)
LightSC: The Making of a Usable Security Classification Tool for DevSecOps
par: Shrestha, Manish, et autres
Publié: (2024)
par: Shrestha, Manish, et autres
Publié: (2024)
CyberESP: An Integrated Cybersecurity Framework for SMEs
par: Jose A. Calvo‐Manzano, et autres
Publié: (2025)
par: Jose A. Calvo‐Manzano, et autres
Publié: (2025)
Learning to Communicate in Multi-Agent Reinforcement Learning for Autonomous Cyber Defence
par: Contractor, Faizan, et autres
Publié: (2025)
par: Contractor, Faizan, et autres
Publié: (2025)
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
par: Ristea, Dan, et autres
Publié: (2024)
par: Ristea, Dan, et autres
Publié: (2024)
An Overview on Cyber Crime and Cybersecurity: Trends, Issues, and Challenges
par: Neha kumari
Publié: (2025)
par: Neha kumari
Publié: (2025)
Cyber-Zero: Training Cybersecurity Agents without Runtime
par: Zhuo, Terry Yue, et autres
Publié: (2025)
par: Zhuo, Terry Yue, et autres
Publié: (2025)
Dynamic Cyber Ranges
par: Mayoral-Vilches, Víctor, et autres
Publié: (2026)
par: Mayoral-Vilches, Víctor, et autres
Publié: (2026)
CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge
par: Keppler, Gustav, et autres
Publié: (2026)
par: Keppler, Gustav, et autres
Publié: (2026)
CyberAId: AI-Driven Cybersecurity for Financial Service Providers
par: Fatouros, George, et autres
Publié: (2026)
par: Fatouros, George, et autres
Publié: (2026)
CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
par: Fan, Yihe, et autres
Publié: (2026)
par: Fan, Yihe, et autres
Publié: (2026)
Cyber Risk Taxonomies: Statistical Analysis of Cybersecurity Risk Classifications
par: Malavasi, Matteo, et autres
Publié: (2024)
par: Malavasi, Matteo, et autres
Publié: (2024)
Artificial Intelligence in Cybersecurity: Building Resilient Cyber Diplomacy Frameworks
par: Stoltz, Michael
Publié: (2024)
par: Stoltz, Michael
Publié: (2024)
OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models
par: Liu, Yuhe, et autres
Publié: (2023)
par: Liu, Yuhe, et autres
Publié: (2023)
Guidance Graph Optimization for Lifelong Multi-Agent Path Finding
par: Zhang, Yulun, et autres
Publié: (2024)
par: Zhang, Yulun, et autres
Publié: (2024)
SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models
par: Cui, Huining, et autres
Publié: (2025)
par: Cui, Huining, et autres
Publié: (2025)
Sexualidades disidentes en la narrativa española reciente: políticas sexuales, cine y subversión en Mae West y yo (2011) de Eduardo Mendicutti
par: Facundo Saxe
Publié: (2016)
par: Facundo Saxe
Publié: (2016)
Isabel Sarli, Alba Mujica y Sabaleros (1959). Del archivo de sentimientos al multiverso de disidencias sexuales
par: Facundo Saxe
Publié: (2025)
par: Facundo Saxe
Publié: (2025)
MCBench: A Benchmark Suite for Monte Carlo Sampling Algorithms
par: Ding, Zeyu, et autres
Publié: (2025)
par: Ding, Zeyu, et autres
Publié: (2025)
Long Sync Word Frame Synchronization for Future Wireless Networks
par: Nikolaidis, Dimitris
Publié: (2026)
par: Nikolaidis, Dimitris
Publié: (2026)
Custom frame synchronization for easy and rapid deployment
par: Nikolaidis, Dimitris
Publié: (2024)
par: Nikolaidis, Dimitris
Publié: (2024)
Parameterized Hardware Architecture for Frame Synchronization at all Noise Levels
par: Nikolaidis, Dimitris
Publié: (2025)
par: Nikolaidis, Dimitris
Publié: (2025)
Test de Step y capacidad de trabajo en jugadoras de voleibol: la paradoja de un mejor rendimiento en las jugadoras mayores
par: P.T. Nikolaidis
Publié: (2016)
par: P.T. Nikolaidis
Publié: (2016)
Trace ideal criteria for generalized integration operators
par: Nikolaidis, Georgios
Publié: (2025)
par: Nikolaidis, Georgios
Publié: (2025)
Algorithmic Scenario Generation as Quality Diversity Optimization
par: Nikolaidis, Stefanos
Publié: (2024)
par: Nikolaidis, Stefanos
Publié: (2024)
Documents similaires
-
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
par: Wan, Shengye, et autres
Publié: (2024) -
Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique
par: Hariharan, Suhas, et autres
Publié: (2024) -
Bridging the Gap: A Study of AI-based Vulnerability Management between Industry and Academia
par: Wan, Shengye, et autres
Publié: (2024) -
LlamaFirewall: An open source guardrail system for building secure AI agents
par: Chennabasappa, Sahana, et autres
Publié: (2025) -
CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning
par: Deason, Lauren, et autres
Publié: (2025)