CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Gaddi, Matilda, Noh, Jin, Gungor, Onat, Rosing, Tajana |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic
por: Chen, Jing, et al.
Publicado: (2026)
por: Chen, Jing, et al.
Publicado: (2026)
AQUA-LLM: Evaluating Accuracy, Quantization, and Adversarial Robustness Trade-offs in LLMs for Cybersecurity Question Answering
por: Gungor, Onat, et al.
Publicado: (2025)
por: Gungor, Onat, et al.
Publicado: (2025)
EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering
por: Gungor, Onat, et al.
Publicado: (2025)
por: Gungor, Onat, et al.
Publicado: (2025)
CND-IDS: Continual Novelty Detection for Intrusion Detection Systems
por: Fuhrman, Sean, et al.
Publicado: (2025)
por: Fuhrman, Sean, et al.
Publicado: (2025)
ACORN-IDS: Adaptive Continual Novelty Detection for Intrusion Detection Systems
por: Fuhrman, Sean, et al.
Publicado: (2026)
por: Fuhrman, Sean, et al.
Publicado: (2026)
SAFE: Self-Supervised Anomaly Detection Framework for Intrusion Detection
por: Li, Elvin, et al.
Publicado: (2025)
por: Li, Elvin, et al.
Publicado: (2025)
SAGE: Sample-Aware Guarding Engine for Robust Intrusion Detection Against Adversarial Attacks
por: Chen, Jing, et al.
Publicado: (2025)
por: Chen, Jing, et al.
Publicado: (2025)
INTARG: Informed Real-Time Adversarial Attack Generation for Time-Series Regression
por: Tokgoz, Gamze Kirman, et al.
Publicado: (2026)
por: Tokgoz, Gamze Kirman, et al.
Publicado: (2026)
CITADEL: Continual Anomaly Detection for Enhanced Learning in IoT Intrusion Detection
por: Li, Elvin, et al.
Publicado: (2025)
por: Li, Elvin, et al.
Publicado: (2025)
LIGHT-HIDS: A Lightweight and Effective Machine Learning-Based Framework for Robust Host Intrusion Detection
por: Gungor, Onat, et al.
Publicado: (2025)
por: Gungor, Onat, et al.
Publicado: (2025)
ReLATE+: Unified Framework for Adversarial Attack Detection, Classification, and Resilient Model Selection in Time-Series Classification
por: Kocal, Cagla Ipek, et al.
Publicado: (2025)
por: Kocal, Cagla Ipek, et al.
Publicado: (2025)
ReLATE: Resilient Learner Selection for Multivariate Time-Series Classification Against Adversarial Attacks
por: Kocal, Cagla Ipek, et al.
Publicado: (2025)
por: Kocal, Cagla Ipek, et al.
Publicado: (2025)
DYNAMITE: Dynamic Defense Selection for Enhancing Machine Learning-based Intrusion Detection Against Adversarial Attacks
por: Chen, Jing, et al.
Publicado: (2025)
por: Chen, Jing, et al.
Publicado: (2025)
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
por: Bhatt, Manish, et al.
Publicado: (2024)
por: Bhatt, Manish, et al.
Publicado: (2024)
CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models
por: Wan, Shengye, et al.
Publicado: (2024)
por: Wan, Shengye, et al.
Publicado: (2024)
Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models
por: Qian, Wei, et al.
Publicado: (2025)
por: Qian, Wei, et al.
Publicado: (2025)
Automated CVE Analysis: Harnessing Machine Learning In Designing Question-Answering Models For Cybersecurity Information Extraction
por: Faruk, Tanjim Bin
Publicado: (2024)
por: Faruk, Tanjim Bin
Publicado: (2024)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
por: Huang, Yuan
Publicado: (2025)
por: Huang, Yuan
Publicado: (2025)
CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
por: Wang, Zhun, et al.
Publicado: (2025)
por: Wang, Zhun, et al.
Publicado: (2025)
SafeLM: Unified Privacy-Aware Optimization for Trustworthy Federated Large Language Models
por: Mohammad, Noor Islam S., et al.
Publicado: (2026)
por: Mohammad, Noor Islam S., et al.
Publicado: (2026)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
por: Shen, Xinjie, et al.
Publicado: (2025)
por: Shen, Xinjie, et al.
Publicado: (2025)
Cyber-Zero: Training Cybersecurity Agents without Runtime
por: Zhuo, Terry Yue, et al.
Publicado: (2025)
por: Zhuo, Terry Yue, et al.
Publicado: (2025)
Transportation Cyber Incident Awareness through Generative AI-Based Incident Analysis and Retrieval-Augmented Question-Answering Systems
por: Thomas, Ostonya, et al.
Publicado: (2025)
por: Thomas, Ostonya, et al.
Publicado: (2025)
Cybersecurity AI Benchmark (CAIBench): A Meta-Benchmark for Evaluating Cybersecurity AI Agents
por: Sanz-Gómez, María, et al.
Publicado: (2025)
por: Sanz-Gómez, María, et al.
Publicado: (2025)
A RAG-Based Question-Answering Solution for Cyber-Attack Investigation and Attribution
por: Rajapaksha, Sampath, et al.
Publicado: (2024)
por: Rajapaksha, Sampath, et al.
Publicado: (2024)
Adaptive Backtracking for Privacy Protection in Large Language Models
por: Yao, Zhihao, et al.
Publicado: (2025)
por: Yao, Zhihao, et al.
Publicado: (2025)
Analysis of Privacy Leakage in Federated Large Language Models
por: Vu, Minh N., et al.
Publicado: (2024)
por: Vu, Minh N., et al.
Publicado: (2024)
Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques
por: Jaffal, Niveen O., et al.
Publicado: (2025)
por: Jaffal, Niveen O., et al.
Publicado: (2025)
Towards Characterizing Cyber Networks with Large Language Models
por: Hartsock, Alaric, et al.
Publicado: (2024)
por: Hartsock, Alaric, et al.
Publicado: (2024)
Large Language Models Are Unreliable for Cyber Threat Intelligence
por: Mezzi, Emanuele, et al.
Publicado: (2025)
por: Mezzi, Emanuele, et al.
Publicado: (2025)
CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
por: Yu, Zhengmin, et al.
Publicado: (2024)
por: Yu, Zhengmin, et al.
Publicado: (2024)
Large Language Models in Cybersecurity: State-of-the-Art
por: Motlagh, Farzad Nourmohammadzadeh, et al.
Publicado: (2024)
por: Motlagh, Farzad Nourmohammadzadeh, et al.
Publicado: (2024)
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
por: Shi, Haonan, et al.
Publicado: (2025)
por: Shi, Haonan, et al.
Publicado: (2025)
Backdooring Masked Diffusion Language Models
por: Cao, Daniel Yiming, et al.
Publicado: (2026)
por: Cao, Daniel Yiming, et al.
Publicado: (2026)
CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models
por: Wahréus, Johan, et al.
Publicado: (2025)
por: Wahréus, Johan, et al.
Publicado: (2025)
Large Language Models for Cyber Security
por: Somani, Raunak, et al.
Publicado: (2025)
por: Somani, Raunak, et al.
Publicado: (2025)
CyberMetric: A Benchmark Dataset based on Retrieval-Augmented Generation for Evaluating LLMs in Cybersecurity Knowledge
por: Tihanyi, Norbert, et al.
Publicado: (2024)
por: Tihanyi, Norbert, et al.
Publicado: (2024)
Privacy Auditing of Large Language Models
por: Panda, Ashwinee, et al.
Publicado: (2025)
por: Panda, Ashwinee, et al.
Publicado: (2025)
Privacy-Preserving Offloading for Large Language Models in 6G Vehicular Networks
por: Badidi, Ikhlasse, et al.
Publicado: (2025)
por: Badidi, Ikhlasse, et al.
Publicado: (2025)
Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness
por: Shafee, Samaneh, et al.
Publicado: (2024)
por: Shafee, Samaneh, et al.
Publicado: (2024)
Ejemplares similares
-
CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic
por: Chen, Jing, et al.
Publicado: (2026) -
AQUA-LLM: Evaluating Accuracy, Quantization, and Adversarial Robustness Trade-offs in LLMs for Cybersecurity Question Answering
por: Gungor, Onat, et al.
Publicado: (2025) -
EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering
por: Gungor, Onat, et al.
Publicado: (2025) -
CND-IDS: Continual Novelty Detection for Intrusion Detection Systems
por: Fuhrman, Sean, et al.
Publicado: (2025) -
ACORN-IDS: Adaptive Continual Novelty Detection for Intrusion Detection Systems
por: Fuhrman, Sean, et al.
Publicado: (2026)