Measuring Safety Alignment Effects in Autonomous Security Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | David, Isaac, Gervais, Arthur |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
Multi-Agent Penetration Testing AI for the Web
di: David, Isaac, et al.
Pubblicazione: (2025)
di: David, Isaac, et al.
Pubblicazione: (2025)
Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
AuthorMist: Evading AI Text Detectors with Reinforcement Learning
di: David, Isaac, et al.
Pubblicazione: (2025)
di: David, Isaac, et al.
Pubblicazione: (2025)
Towards Optimal Agentic Architectures for Offensive Security Tasks
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
AI Agent Smart Contract Exploit Generation
di: Gervais, Arthur, et al.
Pubblicazione: (2025)
di: Gervais, Arthur, et al.
Pubblicazione: (2025)
Alignment Contracts for Agentic Security Systems
di: David, Isaac, et al.
Pubblicazione: (2026)
di: David, Isaac, et al.
Pubblicazione: (2026)
Agent Safety Alignment via Reinforcement Learning
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
di: Sha, Zeyang, et al.
Pubblicazione: (2025)
AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents
di: Zhang, Yixiang, et al.
Pubblicazione: (2026)
di: Zhang, Yixiang, et al.
Pubblicazione: (2026)
SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers
di: Qin, Kaihua, et al.
Pubblicazione: (2026)
di: Qin, Kaihua, et al.
Pubblicazione: (2026)
Agentic JWT: A Secure Delegation Protocol for Autonomous AI Agents
di: Goswami, Abhishek
Pubblicazione: (2025)
di: Goswami, Abhishek
Pubblicazione: (2025)
FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment
di: Kuznetsov, Daniel, et al.
Pubblicazione: (2026)
di: Kuznetsov, Daniel, et al.
Pubblicazione: (2026)
Caging the Agents: A Zero Trust Security Architecture for Autonomous AI in Healthcare
di: Maiti, Saikat
Pubblicazione: (2026)
di: Maiti, Saikat
Pubblicazione: (2026)
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
di: Cheng, Hao, et al.
Pubblicazione: (2026)
di: Cheng, Hao, et al.
Pubblicazione: (2026)
Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats
di: Deng, Xinhao, et al.
Pubblicazione: (2026)
di: Deng, Xinhao, et al.
Pubblicazione: (2026)
Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
di: Li, Jiaqi, et al.
Pubblicazione: (2026)
TxRay: Agentic Postmortem of Live Blockchain Attacks
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
Autonomous Intelligent Agents for Natural-Language-Driven Web Execution with Integrated Security Assurance
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard
di: Abdelnabi, Sahar, et al.
Pubblicazione: (2026)
di: Abdelnabi, Sahar, et al.
Pubblicazione: (2026)
Reimagining Safety Alignment with An Image
di: Xia, Yifan, et al.
Pubblicazione: (2025)
di: Xia, Yifan, et al.
Pubblicazione: (2025)
The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents
di: Wu, Baoyuan, et al.
Pubblicazione: (2026)
di: Wu, Baoyuan, et al.
Pubblicazione: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
di: Campbell, David, et al.
Pubblicazione: (2026)
di: Campbell, David, et al.
Pubblicazione: (2026)
Security of AI Agents
di: He, Yifeng, et al.
Pubblicazione: (2024)
di: He, Yifeng, et al.
Pubblicazione: (2024)
aiXamine: Simplified LLM Safety and Security
di: Deniz, Fatih, et al.
Pubblicazione: (2025)
di: Deniz, Fatih, et al.
Pubblicazione: (2025)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
di: Ferrand, Jean-Charles Noirot, et al.
Pubblicazione: (2025)
Agents for Agents: An Interrogator-Based Secure Framework for Autonomous Internet of Underwater Things
di: Akarma, Ali, et al.
Pubblicazione: (2026)
di: Akarma, Ali, et al.
Pubblicazione: (2026)
Cisco Integrated AI Security and Safety Framework Report
di: Chang, Amy, et al.
Pubblicazione: (2025)
di: Chang, Amy, et al.
Pubblicazione: (2025)
SoK: Towards Security and Safety of Edge AI
di: Wingarz, Tatjana, et al.
Pubblicazione: (2024)
di: Wingarz, Tatjana, et al.
Pubblicazione: (2024)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
di: Li, MingSheng, et al.
Pubblicazione: (2025)
di: Li, MingSheng, et al.
Pubblicazione: (2025)
CSLE: A Reinforcement Learning Platform for Autonomous Security Management
di: Hammar, Kim
Pubblicazione: (2026)
di: Hammar, Kim
Pubblicazione: (2026)
Security and Resilience in Autonomous Vehicles: A Proactive Design Approach
di: Tsai, Chieh, et al.
Pubblicazione: (2026)
di: Tsai, Chieh, et al.
Pubblicazione: (2026)
Context Matters: Repository-Aware Security Analysis of the Agent Skill Ecosystem
di: Holzbauer, Florian, et al.
Pubblicazione: (2026)
di: Holzbauer, Florian, et al.
Pubblicazione: (2026)
Systematization of Knowledge: Security and Safety in the Model Context Protocol Ecosystem
di: Gaire, Shiva, et al.
Pubblicazione: (2025)
di: Gaire, Shiva, et al.
Pubblicazione: (2025)
AI Risk Management Should Incorporate Both Safety and Security
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis
di: Li, Zhiyuan, et al.
Pubblicazione: (2026)
di: Li, Zhiyuan, et al.
Pubblicazione: (2026)
The Aegis Protocol: A Foundational Security Framework for Autonomous AI Agents
di: Adapala, Sai Teja Reddy, et al.
Pubblicazione: (2025)
di: Adapala, Sai Teja Reddy, et al.
Pubblicazione: (2025)
Agent Security is a Systems Problem
di: Christodorescu, Mihai, et al.
Pubblicazione: (2026)
di: Christodorescu, Mihai, et al.
Pubblicazione: (2026)
Security of Internet of Agents: Attacks and Countermeasures
di: Wang, Yuntao, et al.
Pubblicazione: (2025)
di: Wang, Yuntao, et al.
Pubblicazione: (2025)
Matching Ranks Over Probability Yields Truly Deep Safety Alignment
di: Vega, Jason, et al.
Pubblicazione: (2025)
di: Vega, Jason, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications
di: David, Isaac, et al.
Pubblicazione: (2026) -
Multi-Agent Penetration Testing AI for the Web
di: David, Isaac, et al.
Pubblicazione: (2025) -
Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches
di: David, Isaac, et al.
Pubblicazione: (2026) -
AuthorMist: Evading AI Text Detectors with Reinforcement Learning
di: David, Isaac, et al.
Pubblicazione: (2025) -
Towards Optimal Agentic Architectures for Offensive Security Tasks
di: David, Isaac, et al.
Pubblicazione: (2026)