Cyber-Zero: Training Cybersecurity Agents without Runtime
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhuo, Terry Yue, Wang, Dingmin, Ding, Hantian, Kumar, Varun, Wang, Zijian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
par: Zhuo, Terry Yue, et autres
Publié: (2025)
par: Zhuo, Terry Yue, et autres
Publié: (2025)
Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
par: You, Weiqiu, et autres
Publié: (2024)
par: You, Weiqiu, et autres
Publié: (2024)
Image Hijacks: Adversarial Images can Control Generative Models at Runtime
par: Bailey, Luke, et autres
Publié: (2023)
par: Bailey, Luke, et autres
Publié: (2023)
ThreatCrawl: A BERT-based Focused Crawler for the Cybersecurity Domain
par: Kuehn, Philipp, et autres
Publié: (2023)
par: Kuehn, Philipp, et autres
Publié: (2023)
Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness
par: Shafee, Samaneh, et autres
Publié: (2024)
par: Shafee, Samaneh, et autres
Publié: (2024)
BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems
par: Zhang, Andy K., et autres
Publié: (2025)
par: Zhang, Andy K., et autres
Publié: (2025)
SecFormer: Fast and Accurate Privacy-Preserving Inference for Transformer Models via SMPC
par: Luo, Jinglong, et autres
Publié: (2024)
par: Luo, Jinglong, et autres
Publié: (2024)
Automated CVE Analysis: Harnessing Machine Learning In Designing Question-Answering Models For Cybersecurity Information Extraction
par: Faruk, Tanjim Bin
Publié: (2024)
par: Faruk, Tanjim Bin
Publié: (2024)
AgentArmor: Enforcing Program Analysis on Agent Runtime Trace to Defend Against Prompt Injection
par: Wang, Peiran, et autres
Publié: (2025)
par: Wang, Peiran, et autres
Publié: (2025)
Leaner Training, Lower Leakage: Revisiting Memorization in LLM Fine-Tuning with LoRA
par: Wang, Fei, et autres
Publié: (2025)
par: Wang, Fei, et autres
Publié: (2025)
CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
par: Wang, Zhun, et autres
Publié: (2025)
par: Wang, Zhun, et autres
Publié: (2025)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
par: Li, Haodong, et autres
Publié: (2024)
par: Li, Haodong, et autres
Publié: (2024)
A Robust Cybersecurity Topic Classification Tool
par: Pelofske, Elijah, et autres
Publié: (2021)
par: Pelofske, Elijah, et autres
Publié: (2021)
Large Language Models in Cybersecurity: State-of-the-Art
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
par: Wang, Kun, et autres
Publié: (2025)
par: Wang, Kun, et autres
Publié: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Intrinsic Fingerprint of LLMs: Continue Training is NOT All You Need to Steal A Model!
par: Yoon, Do-hyeon, et autres
Publié: (2025)
par: Yoon, Do-hyeon, et autres
Publié: (2025)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
RLShield: Practical Multi-Agent RL for Financial Cyber Defense with Attack-Surface MDPs and Real-Time Response Orchestration
par: Nayak, Srikumar
Publié: (2026)
par: Nayak, Srikumar
Publié: (2026)
Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training
par: Labiad, Ismail, et autres
Publié: (2025)
par: Labiad, Ismail, et autres
Publié: (2025)
AirGapAgent: Protecting Privacy-Conscious Conversational Agents
par: Bagdasarian, Eugene, et autres
Publié: (2024)
par: Bagdasarian, Eugene, et autres
Publié: (2024)
Transferable Embedding Inversion Attack: Uncovering Privacy Risks in Text Embeddings without Model Queries
par: Huang, Yu-Hsiang, et autres
Publié: (2024)
par: Huang, Yu-Hsiang, et autres
Publié: (2024)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
par: Hu, Kai, et autres
Publié: (2025)
par: Hu, Kai, et autres
Publié: (2025)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
par: Li, Tung-Ling, et autres
Publié: (2025)
par: Li, Tung-Ling, et autres
Publié: (2025)
The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions
par: Wallace, Eric, et autres
Publié: (2024)
par: Wallace, Eric, et autres
Publié: (2024)
Adversarial Data Poisoning for Fake News Detection: How to Make a Model Misclassify a Target News without Modifying It
par: Siciliano, Federico, et autres
Publié: (2023)
par: Siciliano, Federico, et autres
Publié: (2023)
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
par: Bhatt, Manish, et autres
Publié: (2024)
par: Bhatt, Manish, et autres
Publié: (2024)
LLM Cyber Evaluations Don't Capture Real-World Risk
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
Can We Infer Confidential Properties of Training Data from LLMs?
par: Huang, Pengrun, et autres
Publié: (2025)
par: Huang, Pengrun, et autres
Publié: (2025)
Contextual Agent Security: A Policy for Every Purpose
par: Tsai, Lillian, et autres
Publié: (2025)
par: Tsai, Lillian, et autres
Publié: (2025)
Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent
par: Zhang, Boyang, et autres
Publié: (2026)
par: Zhang, Boyang, et autres
Publié: (2026)
To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack
par: Zhuo, Terry Yue, et autres
Publié: (2026)
par: Zhuo, Terry Yue, et autres
Publié: (2026)
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
par: Liu, Jinxin, et autres
Publié: (2024)
par: Liu, Jinxin, et autres
Publié: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against
par: Enkhbayar, Tsogt-Ochir
Publié: (2025)
par: Enkhbayar, Tsogt-Ochir
Publié: (2025)
A Curious Case of Searching for the Correlation between Training Data and Adversarial Robustness of Transformer Textual Models
par: Dang, Cuong, et autres
Publié: (2024)
par: Dang, Cuong, et autres
Publié: (2024)
AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research
par: Apostu, Alexandru-Mihai, et autres
Publié: (2025)
par: Apostu, Alexandru-Mihai, et autres
Publié: (2025)
WARDEN: Multi-Directional Backdoor Watermarks for Embedding-as-a-Service Copyright Protection
par: Shetty, Anudeex, et autres
Publié: (2024)
par: Shetty, Anudeex, et autres
Publié: (2024)
When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Documents similaires
-
Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
par: Zhuo, Terry Yue, et autres
Publié: (2025) -
Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
par: You, Weiqiu, et autres
Publié: (2024) -
Image Hijacks: Adversarial Images can Control Generative Models at Runtime
par: Bailey, Luke, et autres
Publié: (2023) -
ThreatCrawl: A BERT-based Focused Crawler for the Cybersecurity Domain
par: Kuehn, Philipp, et autres
Publié: (2023) -
Evaluation of LLM Chatbots for OSINT-based Cyber Threat Awareness
par: Shafee, Samaneh, et autres
Publié: (2024)