Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities
Fuente:
arXiv
Salvato in:
| Autore principale: | Mouzouni, Charafeddine |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration
di: Mouzouni, Charafeddine
Pubblicazione: (2026)
di: Mouzouni, Charafeddine
Pubblicazione: (2026)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026)
di: Li, Xueyi, et al.
Pubblicazione: (2026)
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
di: Ji, Zimo, et al.
Pubblicazione: (2025)
di: Ji, Zimo, et al.
Pubblicazione: (2025)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
di: Ahmed, Mohamed, et al.
Pubblicazione: (2025)
di: Ahmed, Mohamed, et al.
Pubblicazione: (2025)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
LLM Agents can Autonomously Exploit One-day Vulnerabilities
di: Fang, Richard, et al.
Pubblicazione: (2024)
di: Fang, Richard, et al.
Pubblicazione: (2024)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
di: Shen, Guangyu, et al.
Pubblicazione: (2024)
di: Shen, Guangyu, et al.
Pubblicazione: (2024)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
di: Jin, Xisen, et al.
Pubblicazione: (2026)
di: Jin, Xisen, et al.
Pubblicazione: (2026)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection
di: Sahoo, Devanshu, et al.
Pubblicazione: (2025)
di: Sahoo, Devanshu, et al.
Pubblicazione: (2025)
Contextualized Privacy Defense for LLM Agents
di: Wen, Yule, et al.
Pubblicazione: (2026)
di: Wen, Yule, et al.
Pubblicazione: (2026)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
di: Ding, Ruomeng, et al.
Pubblicazione: (2026)
di: Ding, Ruomeng, et al.
Pubblicazione: (2026)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
di: Das, Saswat, et al.
Pubblicazione: (2026)
di: Das, Saswat, et al.
Pubblicazione: (2026)
Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents
di: Das, Saswat, et al.
Pubblicazione: (2025)
di: Das, Saswat, et al.
Pubblicazione: (2025)
Searching for Privacy Risks in LLM Agents via Simulation
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2025)
When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
di: Xu, Naen, et al.
Pubblicazione: (2026)
di: Xu, Naen, et al.
Pubblicazione: (2026)
Large Language Model Sentinel: LLM Agent for Adversarial Purification
di: Lin, Guang, et al.
Pubblicazione: (2024)
di: Lin, Guang, et al.
Pubblicazione: (2024)
Exploring Backdoor Vulnerabilities of Chat Models
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search
di: Lee, Hyomin, et al.
Pubblicazione: (2026)
di: Lee, Hyomin, et al.
Pubblicazione: (2026)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
di: Wang, Liwen, et al.
Pubblicazione: (2025)
di: Wang, Liwen, et al.
Pubblicazione: (2025)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
di: Dong, Jianshuo, et al.
Pubblicazione: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
From Vulnerabilities to Remediation: A Systematic Literature Review of LLMs in Code Security
di: Basic, Enna, et al.
Pubblicazione: (2024)
di: Basic, Enna, et al.
Pubblicazione: (2024)
MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
di: Zhou, Kaiwen, et al.
Pubblicazione: (2025)
IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents
di: An, Hengyu, et al.
Pubblicazione: (2025)
di: An, Hengyu, et al.
Pubblicazione: (2025)
A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
di: Correia, Pedro H. Barcha, et al.
Pubblicazione: (2026)
di: Correia, Pedro H. Barcha, et al.
Pubblicazione: (2026)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Systematically Analyzing Prompt Injection Vulnerabilities in Diverse LLM Architectures
di: Benjamin, Victoria, et al.
Pubblicazione: (2024)
di: Benjamin, Victoria, et al.
Pubblicazione: (2024)
Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents
di: Jiang, Linxi, et al.
Pubblicazione: (2026)
di: Jiang, Linxi, et al.
Pubblicazione: (2026)
Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
di: Wang, Xiaoqing, et al.
Pubblicazione: (2025)
di: Wang, Xiaoqing, et al.
Pubblicazione: (2025)
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Code Vulnerability Detection Across Different Programming Languages with AI Models
di: Humran, Hael Abdulhakim Ali, et al.
Pubblicazione: (2025)
di: Humran, Hael Abdulhakim Ali, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration
di: Mouzouni, Charafeddine
Pubblicazione: (2026) -
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026) -
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
di: Ji, Zimo, et al.
Pubblicazione: (2025) -
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025) -
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
di: Nawal, Aditya, et al.
Pubblicazione: (2026)