SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
Fuente:
arXiv
Salvato in:
| Autori principali: | Duan, Zenghao, Tian, Yuxin, Yin, Zhiyi, Pang, Liang, Deng, Jingcheng, Wei, Zihao, Xu, Shicheng, Ge, Yuyao, Cheng, Xueqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks
di: Schmotz, David, et al.
Pubblicazione: (2026)
di: Schmotz, David, et al.
Pubblicazione: (2026)
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
di: Feng, Yunhao, et al.
Pubblicazione: (2026)
No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills
di: Li, Ying, et al.
Pubblicazione: (2026)
di: Li, Ying, et al.
Pubblicazione: (2026)
Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems
di: Zhou, Zhaojiacheng
Pubblicazione: (2026)
di: Zhou, Zhaojiacheng
Pubblicazione: (2026)
Red-Teaming LLM Multi-Agent Systems via Communication Attacks
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills
di: Liu, Yiyong, et al.
Pubblicazione: (2026)
di: Liu, Yiyong, et al.
Pubblicazione: (2026)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents
di: Fujinuma, Yoshinari, et al.
Pubblicazione: (2026)
di: Fujinuma, Yoshinari, et al.
Pubblicazione: (2026)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents
di: Jia, Xiaojun, et al.
Pubblicazione: (2026)
di: Jia, Xiaojun, et al.
Pubblicazione: (2026)
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
di: Zhou, Andy, et al.
Pubblicazione: (2025)
di: Zhou, Andy, et al.
Pubblicazione: (2025)
SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces
di: Jin, Chang, et al.
Pubblicazione: (2026)
di: Jin, Chang, et al.
Pubblicazione: (2026)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
di: Zhang, Junke, et al.
Pubblicazione: (2026)
di: Zhang, Junke, et al.
Pubblicazione: (2026)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
di: Horal, Artur, et al.
Pubblicazione: (2025)
di: Horal, Artur, et al.
Pubblicazione: (2025)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
di: Hsu, Chia-Yi, et al.
Pubblicazione: (2026)
di: Hsu, Chia-Yi, et al.
Pubblicazione: (2026)
MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
di: Syros, Georgios, et al.
Pubblicazione: (2026)
di: Syros, Georgios, et al.
Pubblicazione: (2026)
SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills
di: Hou, Yinghan, et al.
Pubblicazione: (2026)
di: Hou, Yinghan, et al.
Pubblicazione: (2026)
Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
di: Saha, Shoumik, et al.
Pubblicazione: (2026)
di: Saha, Shoumik, et al.
Pubblicazione: (2026)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
LAAF: Logic-layer Automated Attack Framework A Systematic Red-Teaming Methodology for LPCI Vulnerabilities in Agentic Large Language Model Systems
di: Atta, Hammad, et al.
Pubblicazione: (2026)
di: Atta, Hammad, et al.
Pubblicazione: (2026)
When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions
di: Qi, Minfeng, et al.
Pubblicazione: (2026)
di: Qi, Minfeng, et al.
Pubblicazione: (2026)
Leveraging Reinforcement Learning in Red Teaming for Advanced Ransomware Attack Simulations
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
Automated Progressive Red Teaming
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
CyberSleuth: Autonomous Blue-Team LLM Agent for Web Attack Forensics
di: Fumero, Stefano, et al.
Pubblicazione: (2025)
di: Fumero, Stefano, et al.
Pubblicazione: (2025)
An Attack Traffic Identification Method Based on Temporal Spectrum
di: Xie, Wenwei, et al.
Pubblicazione: (2024)
di: Xie, Wenwei, et al.
Pubblicazione: (2024)
LLM Latent Reasoning as Chain of Superposition
di: Deng, Jingcheng, et al.
Pubblicazione: (2025)
di: Deng, Jingcheng, et al.
Pubblicazione: (2025)
MRMMIA: Membership Inference Attacks on Memory in Chat Agents
di: Chen, Kai, et al.
Pubblicazione: (2026)
di: Chen, Kai, et al.
Pubblicazione: (2026)
SkillTester: Benchmarking Utility and Security of Agent Skills
di: Wang, Leye, et al.
Pubblicazione: (2026)
di: Wang, Leye, et al.
Pubblicazione: (2026)
Finding Software Supply Chain Attack Paths with Logical Attack Graphs
di: Soeiro, Luıs, et al.
Pubblicazione: (2025)
di: Soeiro, Luıs, et al.
Pubblicazione: (2025)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
di: Deng, Jingcheng, et al.
Pubblicazione: (2026)
SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills
di: Wu, Jiangrong, et al.
Pubblicazione: (2026)
di: Wu, Jiangrong, et al.
Pubblicazione: (2026)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems
di: Maloyan, Narek, et al.
Pubblicazione: (2026)
di: Maloyan, Narek, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models
di: Duan, Zenghao, et al.
Pubblicazione: (2026) -
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
di: Tie, Guiyao, et al.
Pubblicazione: (2026) -
Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks
di: Schmotz, David, et al.
Pubblicazione: (2026) -
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
di: Feng, Yunhao, et al.
Pubblicazione: (2026) -
No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills
di: Li, Ying, et al.
Pubblicazione: (2026)