Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Noever, David |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models And A Second Opinion Use Case: The Pocket Professional
par: Noever, David
Publié: (2024)
par: Noever, David
Publié: (2024)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
par: Noever, David, et autres
Publié: (2024)
par: Noever, David, et autres
Publié: (2024)
Towards Safe and Honest AI Agents with Neural Self-Other Overlap
par: Carauleanu, Marc, et autres
Publié: (2024)
par: Carauleanu, Marc, et autres
Publié: (2024)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
par: Jiang, Yukun, et autres
Publié: (2026)
par: Jiang, Yukun, et autres
Publié: (2026)
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
par: Shi, Yunfan
Publié: (2024)
par: Shi, Yunfan
Publié: (2024)
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
par: Chu, Junjie, et autres
Publié: (2026)
par: Chu, Junjie, et autres
Publié: (2026)
HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation
par: Ristea, Dan, et autres
Publié: (2024)
par: Ristea, Dan, et autres
Publié: (2024)
SkillTester: Benchmarking Utility and Security of Agent Skills
par: Wang, Leye, et autres
Publié: (2026)
par: Wang, Leye, et autres
Publié: (2026)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026)
par: Tie, Guiyao, et autres
Publié: (2026)
SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents
par: Jia, Xiaojun, et autres
Publié: (2026)
par: Jia, Xiaojun, et autres
Publié: (2026)
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
Context Matters: Repository-Aware Security Analysis of the Agent Skill Ecosystem
par: Holzbauer, Florian, et autres
Publié: (2026)
par: Holzbauer, Florian, et autres
Publié: (2026)
SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills
par: Hou, Yinghan, et autres
Publié: (2026)
par: Hou, Yinghan, et autres
Publié: (2026)
AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills
par: Zhuang, Haomin, et autres
Publié: (2026)
par: Zhuang, Haomin, et autres
Publié: (2026)
Detecting Adversarial Fine-tuning with Auditing Agents
par: Egler, Sarah, et autres
Publié: (2025)
par: Egler, Sarah, et autres
Publié: (2025)
Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem
par: Beurer-Kellner, Luca, et autres
Publié: (2026)
par: Beurer-Kellner, Luca, et autres
Publié: (2026)
Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills
par: Lv, Lijia, et autres
Publié: (2026)
par: Lv, Lijia, et autres
Publié: (2026)
No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills
par: Li, Ying, et autres
Publié: (2026)
par: Li, Ying, et autres
Publié: (2026)
Living Off the LLM: How LLMs Will Change Adversary Tactics
par: Oesch, Sean, et autres
Publié: (2025)
par: Oesch, Sean, et autres
Publié: (2025)
Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis
par: Li, Zhiyuan, et autres
Publié: (2026)
par: Li, Zhiyuan, et autres
Publié: (2026)
Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems
par: Zhou, Zhaojiacheng
Publié: (2026)
par: Zhou, Zhaojiacheng
Publié: (2026)
RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents
par: Xiao, Wenjie, et autres
Publié: (2026)
par: Xiao, Wenjie, et autres
Publié: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
par: Domico, Kyle, et autres
Publié: (2025)
par: Domico, Kyle, et autres
Publié: (2025)
SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents
par: Ouyang, Yipeng, et autres
Publié: (2026)
par: Ouyang, Yipeng, et autres
Publié: (2026)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
par: Chen, Zhihao, et autres
Publié: (2026)
par: Chen, Zhihao, et autres
Publié: (2026)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
par: Cao, Tri, et autres
Publié: (2026)
par: Cao, Tri, et autres
Publié: (2026)
How stealthy is stealthy? Studying the Efficacy of Black-Box Adversarial Attacks in the Real World
par: Panebianco, Francesco, et autres
Publié: (2025)
par: Panebianco, Francesco, et autres
Publié: (2025)
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchers
par: Liu, Songyang, et autres
Publié: (2026)
par: Liu, Songyang, et autres
Publié: (2026)
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
par: Saha, Shoumik, et autres
Publié: (2026)
par: Saha, Shoumik, et autres
Publié: (2026)
DECEPTICON: How Dark Patterns Manipulate Web Agents
par: Cuvin, Phil, et autres
Publié: (2025)
par: Cuvin, Phil, et autres
Publié: (2025)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
par: Shao, Shuo, et autres
Publié: (2024)
par: Shao, Shuo, et autres
Publié: (2024)
Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack
par: Kang, Daewon, et autres
Publié: (2025)
par: Kang, Daewon, et autres
Publié: (2025)
When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems
par: Wang, Su, et autres
Publié: (2026)
par: Wang, Su, et autres
Publié: (2026)
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
par: Ding, Xuwei, et autres
Publié: (2026)
par: Ding, Xuwei, et autres
Publié: (2026)
Next-Generation Phishing: How LLM Agents Empower Cyber Attackers
par: Afane, Khalifa, et autres
Publié: (2024)
par: Afane, Khalifa, et autres
Publié: (2024)
Behavioral Integrity Verification for AI Agent Skills
par: Wu, Yuhao, et autres
Publié: (2026)
par: Wu, Yuhao, et autres
Publié: (2026)
AccLock: Unlocking Identity with Heartbeat Using In-Ear Accelerometers
par: Wang, Lei, et autres
Publié: (2026)
par: Wang, Lei, et autres
Publié: (2026)
From Allies to Adversaries: Manipulating LLM Tool-Calling through Adversarial Injection
par: Wang, Haowei, et autres
Publié: (2024)
par: Wang, Haowei, et autres
Publié: (2024)
E-PhishGen: Unlocking Novel Research in Phishing Email Detection
par: Pajola, Luca, et autres
Publié: (2025)
par: Pajola, Luca, et autres
Publié: (2025)
Documents similaires
-
Language Models And A Second Opinion Use Case: The Pocket Professional
par: Noever, David
Publié: (2024) -
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
par: Noever, David, et autres
Publié: (2024) -
Towards Safe and Honest AI Agents with Neural Self-Other Overlap
par: Carauleanu, Marc, et autres
Publié: (2024) -
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
par: Jiang, Yukun, et autres
Publié: (2026) -
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
par: Shi, Yunfan
Publié: (2024)