CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, Zhengmin, Zeng, Jiutian, Chen, Siyi, Xu, Wenhan, Xu, Dandan, Liu, Xiangyu, Ying, Zonghao, Wang, Nan, Zhang, Yuan, Yang, Min |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models
von: Wahréus, Johan, et al.
Veröffentlicht: (2025)
von: Wahréus, Johan, et al.
Veröffentlicht: (2025)
Large Language Models for Cyber Security
von: Somani, Raunak, et al.
Veröffentlicht: (2025)
von: Somani, Raunak, et al.
Veröffentlicht: (2025)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
von: Fu, Yuchuan, et al.
Veröffentlicht: (2025)
von: Fu, Yuchuan, et al.
Veröffentlicht: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
PLLM-CS: Pre-trained Large Language Model (LLM) for Cyber Threat Detection in Satellite Networks
von: Hassanin, Mohammed, et al.
Veröffentlicht: (2024)
von: Hassanin, Mohammed, et al.
Veröffentlicht: (2024)
CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?
von: Chen, Xiangsen, et al.
Veröffentlicht: (2026)
von: Chen, Xiangsen, et al.
Veröffentlicht: (2026)
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
von: Ristea, Dan, et al.
Veröffentlicht: (2024)
von: Ristea, Dan, et al.
Veröffentlicht: (2024)
SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models
von: Cui, Huining, et al.
Veröffentlicht: (2025)
von: Cui, Huining, et al.
Veröffentlicht: (2025)
Large Language Models for Cyber Security: A Systematic Literature Review
von: Xu, Hanxiang, et al.
Veröffentlicht: (2024)
von: Xu, Hanxiang, et al.
Veröffentlicht: (2024)
ARuleCon: Agentic Security Rule Conversion
von: Xu, Ming, et al.
Veröffentlicht: (2026)
von: Xu, Ming, et al.
Veröffentlicht: (2026)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
von: Yuan, Xiaohan, et al.
Veröffentlicht: (2024)
von: Yuan, Xiaohan, et al.
Veröffentlicht: (2024)
DLP: towards active defense against backdoor attacks with decoupled learning process
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
NBA: defensive distillation for backdoor removal via neural behavior alignment
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
A Comprehensive Overview of Large Language Models (LLMs) for Cyber Defences: Opportunities and Directions
von: Hassanin, Mohammed, et al.
Veröffentlicht: (2024)
von: Hassanin, Mohammed, et al.
Veröffentlicht: (2024)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey
von: Wang, Shang, et al.
Veröffentlicht: (2024)
von: Wang, Shang, et al.
Veröffentlicht: (2024)
An Intelligent Quantum Cyber-Security Framework for Healthcare Data Management
von: Gupta, Kishu, et al.
Veröffentlicht: (2024)
von: Gupta, Kishu, et al.
Veröffentlicht: (2024)
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
von: Bhatt, Manish, et al.
Veröffentlicht: (2024)
von: Bhatt, Manish, et al.
Veröffentlicht: (2024)
SEvenLLM: Benchmarking, Eliciting, and Enhancing Abilities of Large Language Models in Cyber Threat Intelligence
von: Ji, Hangyuan, et al.
Veröffentlicht: (2024)
von: Ji, Hangyuan, et al.
Veröffentlicht: (2024)
Russian Cyber Onslaught was Blunted by Ukrainian Cyber Resilience, not Merely Security
von: Kott, Alexander, et al.
Veröffentlicht: (2024)
von: Kott, Alexander, et al.
Veröffentlicht: (2024)
KAN-LSTM: Benchmarking Kolmogorov-Arnold Networks for Cyber Security Threat Detection in IoT Networks
von: Hassanin, Mohammed
Veröffentlicht: (2026)
von: Hassanin, Mohammed
Veröffentlicht: (2026)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
Mission Aware Cyber-physical Security
von: Bakirtzis, Georgios, et al.
Veröffentlicht: (2017)
von: Bakirtzis, Georgios, et al.
Veröffentlicht: (2017)
SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
Building Resilient SMEs: Harnessing Large Language Models for Cyber Security in Australia
von: Kereopa-Yorke, Benjamin
Veröffentlicht: (2023)
von: Kereopa-Yorke, Benjamin
Veröffentlicht: (2023)
A Survey of AI-Related Cyber Security Risks and Countermeasures in Mobility-as-a-Service
von: Chu, Kai-Fung, et al.
Veröffentlicht: (2024)
von: Chu, Kai-Fung, et al.
Veröffentlicht: (2024)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
von: Mu, Junjie, et al.
Veröffentlicht: (2025)
von: Mu, Junjie, et al.
Veröffentlicht: (2025)
Cyber-Physical Systems Security: A Comprehensive Review of Anomaly Detection Techniques
von: Abshari, Danial, et al.
Veröffentlicht: (2025)
von: Abshari, Danial, et al.
Veröffentlicht: (2025)
CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents
von: Ba, Lei, et al.
Veröffentlicht: (2026)
von: Ba, Lei, et al.
Veröffentlicht: (2026)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
von: Zhang, Deyue, et al.
Veröffentlicht: (2025)
von: Zhang, Deyue, et al.
Veröffentlicht: (2025)
What Skills Do Cyber Security Professionals Need?
von: Ullah, Faheem, et al.
Veröffentlicht: (2025)
von: Ullah, Faheem, et al.
Veröffentlicht: (2025)
From Cyber Security Incident Management to Cyber Security Crisis Management in the European Union
von: Ruohonen, Jukka, et al.
Veröffentlicht: (2025)
von: Ruohonen, Jukka, et al.
Veröffentlicht: (2025)
Secure Group Key Agreement on Cyber-Physical System Buses
von: Peters, Sebastian N., et al.
Veröffentlicht: (2026)
von: Peters, Sebastian N., et al.
Veröffentlicht: (2026)
The Hidden Dangers of Outdated Software: A Cyber Security Perspective
von: Thiyagarajan, Gogulakrishnan, et al.
Veröffentlicht: (2025)
von: Thiyagarajan, Gogulakrishnan, et al.
Veröffentlicht: (2025)
Cyber Security in Energy Informatics: A Non-technical Perspective
von: Dang, Duong, et al.
Veröffentlicht: (2024)
von: Dang, Duong, et al.
Veröffentlicht: (2024)
A Systematic Literature Review of Cyber Security Monitoring in Maritime
von: Vaarandi, Risto, et al.
Veröffentlicht: (2025)
von: Vaarandi, Risto, et al.
Veröffentlicht: (2025)
Cyber Spectrum Intelligence: Security Applications, Challenges and Road Ahead
von: Sciancalepore, Savio, et al.
Veröffentlicht: (2025)
von: Sciancalepore, Savio, et al.
Veröffentlicht: (2025)
On the Cyber-Physical Security of Commercial Indoor Delivery Robot Systems
von: Alshammari, Fayzah, et al.
Veröffentlicht: (2024)
von: Alshammari, Fayzah, et al.
Veröffentlicht: (2024)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models
von: Wahréus, Johan, et al.
Veröffentlicht: (2025) -
Large Language Models for Cyber Security
von: Somani, Raunak, et al.
Veröffentlicht: (2025) -
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
von: Fu, Yuchuan, et al.
Veröffentlicht: (2025) -
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
von: Ying, Zonghao, et al.
Veröffentlicht: (2024) -
PLLM-CS: Pre-trained Large Language Model (LLM) for Cyber Threat Detection in Satellite Networks
von: Hassanin, Mohammed, et al.
Veröffentlicht: (2024)