Policy-Invisible Violations in LLM-Based Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Jie, Gong, Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
par: Wu, Jie, et autres
Publié: (2026)
par: Wu, Jie, et autres
Publié: (2026)
Federated In-Context LLM Agent Learning
par: Wu, Panlong, et autres
Publié: (2024)
par: Wu, Panlong, et autres
Publié: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024)
par: Jia, Feiran, et autres
Publié: (2024)
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
par: Ahmed, Nesreen K., et autres
Publié: (2026)
par: Ahmed, Nesreen K., et autres
Publié: (2026)
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
par: Wang, Kun, et autres
Publié: (2025)
par: Wang, Kun, et autres
Publié: (2025)
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
par: Li, Jing-Jing, et autres
Publié: (2025)
par: Li, Jing-Jing, et autres
Publié: (2025)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
par: Panfilov, Alexander, et autres
Publié: (2025)
par: Panfilov, Alexander, et autres
Publié: (2025)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
par: Wu, Xiaoyu, et autres
Publié: (2025)
par: Wu, Xiaoyu, et autres
Publié: (2025)
Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening
par: Zhang, Mohan, et autres
Publié: (2026)
par: Zhang, Mohan, et autres
Publié: (2026)
Do Phone-Use Agents Respect Your Privacy?
par: Tang, Zhengyang, et autres
Publié: (2026)
par: Tang, Zhengyang, et autres
Publié: (2026)
Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
IsolateGPT: An Execution Isolation Architecture for LLM-Based Agentic Systems
par: Wu, Yuhao, et autres
Publié: (2024)
par: Wu, Yuhao, et autres
Publié: (2024)
TurboFuzzLLM: Turbocharging Mutation-based Fuzzing for Effectively Jailbreaking Large Language Models in Practice
par: Goel, Aman, et autres
Publié: (2025)
par: Goel, Aman, et autres
Publié: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
Adaptive Instruction Composition for Automated LLM Red-Teaming
par: Zymet, Jesse, et autres
Publié: (2026)
par: Zymet, Jesse, et autres
Publié: (2026)
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
par: Halawi, Danny, et autres
Publié: (2024)
par: Halawi, Danny, et autres
Publié: (2024)
Efficient LLM Moderation with Multi-Layer Latent Prototypes
par: Chrabąszcz, Maciej, et autres
Publié: (2025)
par: Chrabąszcz, Maciej, et autres
Publié: (2025)
LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning
par: Spracklen, Joseph, et autres
Publié: (2026)
par: Spracklen, Joseph, et autres
Publié: (2026)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2026)
par: Liang, Buyun, et autres
Publié: (2026)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2025)
par: Liang, Buyun, et autres
Publié: (2025)
Systematically Analyzing Prompt Injection Vulnerabilities in Diverse LLM Architectures
par: Benjamin, Victoria, et autres
Publié: (2024)
par: Benjamin, Victoria, et autres
Publié: (2024)
LLM Cyber Evaluations Don't Capture Real-World Risk
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
par: Lukošiūtė, Kamilė, et autres
Publié: (2025)
Cross-Session Threats in AI Agents: Benchmark, Evaluation, and Algorithms
par: Azarafrooz, Ari
Publié: (2026)
par: Azarafrooz, Ari
Publié: (2026)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
par: Shao, Zedian, et autres
Publié: (2024)
par: Shao, Zedian, et autres
Publié: (2024)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
par: Zhao, Andrew, et autres
Publié: (2025)
par: Zhao, Andrew, et autres
Publié: (2025)
SELF: A Robust Singular Value and Eigenvalue Approach for LLM Fingerprinting
par: Zhang, Hanxiu, et autres
Publié: (2025)
par: Zhang, Hanxiu, et autres
Publié: (2025)
A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens
par: Dobre, David, et autres
Publié: (2025)
par: Dobre, David, et autres
Publié: (2025)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems
par: Zhang, Andy K., et autres
Publié: (2025)
par: Zhang, Andy K., et autres
Publié: (2025)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
par: Liao, Zeyi, et autres
Publié: (2024)
par: Liao, Zeyi, et autres
Publié: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective
par: Yilmaz, Edibe, et autres
Publié: (2026)
par: Yilmaz, Edibe, et autres
Publié: (2026)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
par: Shetty, Anudeex, et autres
Publié: (2026)
par: Shetty, Anudeex, et autres
Publié: (2026)
Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training
par: Labiad, Ismail, et autres
Publié: (2025)
par: Labiad, Ismail, et autres
Publié: (2025)
Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates
par: Zheng, Xiaosen, et autres
Publié: (2024)
par: Zheng, Xiaosen, et autres
Publié: (2024)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
par: Yuan, Zhuowen, et autres
Publié: (2024)
par: Yuan, Zhuowen, et autres
Publié: (2024)
AgentArmor: Enforcing Program Analysis on Agent Runtime Trace to Defend Against Prompt Injection
par: Wang, Peiran, et autres
Publié: (2025)
par: Wang, Peiran, et autres
Publié: (2025)
Documents similaires
-
Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
par: Wu, Jie, et autres
Publié: (2026) -
Federated In-Context LLM Agent Learning
par: Wu, Panlong, et autres
Publié: (2024) -
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024) -
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024) -
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
par: Ahmed, Nesreen K., et autres
Publié: (2026)