AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Weidi, Dai, Shenghong, Liu, Xiaogeng, Banerjee, Suman, Sun, Huan, Chen, Muhao, Xiao, Chaowei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2023)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2023)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
di: Zhang, Yaolun, et al.
Pubblicazione: (2025)
di: Zhang, Yaolun, et al.
Pubblicazione: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
di: Luo, Weidi, et al.
Pubblicazione: (2024)
di: Luo, Weidi, et al.
Pubblicazione: (2024)
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025)
ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
di: Wang, Xinyan, et al.
Pubblicazione: (2026)
di: Wang, Xinyan, et al.
Pubblicazione: (2026)
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
di: Liu, Xiaogeng, et al.
Pubblicazione: (2024)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2024)
OET: Optimization-based prompt injection Evaluation Toolkit
di: Pan, Jinsheng, et al.
Pubblicazione: (2025)
di: Pan, Jinsheng, et al.
Pubblicazione: (2025)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
di: Wang, Peiran, et al.
Pubblicazione: (2024)
di: Wang, Peiran, et al.
Pubblicazione: (2024)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
di: Liu, Qin, et al.
Pubblicazione: (2025)
di: Liu, Qin, et al.
Pubblicazione: (2025)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
Automatic and Universal Prompt Injection Attacks against Large Language Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2024)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2024)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails
di: Li, Nanxi, et al.
Pubblicazione: (2026)
di: Li, Nanxi, et al.
Pubblicazione: (2026)
DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
Learning Efficient Guardrails for Compliance
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
di: Liu, Qin, et al.
Pubblicazione: (2023)
di: Liu, Qin, et al.
Pubblicazione: (2023)
PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents
di: Wu, Yaozu, et al.
Pubblicazione: (2025)
di: Wu, Yaozu, et al.
Pubblicazione: (2025)
Building Effective Safety Guardrails in AI Education Tools
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
di: Clark, Hannah-Beth, et al.
Pubblicazione: (2025)
Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
di: Luo, Weidi, et al.
Pubblicazione: (2025)
di: Luo, Weidi, et al.
Pubblicazione: (2025)
LeanAgent: Lifelong Learning for Formal Theorem Proving
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2024)
di: Kumarappan, Adarsh, et al.
Pubblicazione: (2024)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents
di: Mo, Lingbo, et al.
Pubblicazione: (2024)
di: Mo, Lingbo, et al.
Pubblicazione: (2024)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
di: Xu, Peiyang, et al.
Pubblicazione: (2025)
di: Xu, Peiyang, et al.
Pubblicazione: (2025)
ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems
di: Yuan, Zhuowen, et al.
Pubblicazione: (2026)
di: Yuan, Zhuowen, et al.
Pubblicazione: (2026)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
Safety Guardrails for LLM-Enabled Robots
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
SafeHarbor: Hierarchical Memory-Augmented Guardrail for LLM Agent Safety
di: Liu, Zhe, et al.
Pubblicazione: (2026)
di: Liu, Zhe, et al.
Pubblicazione: (2026)
AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
di: Liu, Dongrui, et al.
Pubblicazione: (2026)
di: Liu, Dongrui, et al.
Pubblicazione: (2026)
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities
di: Mo, Lingbo, et al.
Pubblicazione: (2023)
di: Mo, Lingbo, et al.
Pubblicazione: (2023)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
di: Cho, Dongkyu Derek, et al.
Pubblicazione: (2025)
di: Cho, Dongkyu Derek, et al.
Pubblicazione: (2025)
LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
A Lightweight Explainable Guardrail for Prompt Safety
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
di: Islam, Md Asiful, et al.
Pubblicazione: (2026)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents
di: Chen, Zhaorun, et al.
Pubblicazione: (2026)
di: Chen, Zhaorun, et al.
Pubblicazione: (2026)
Lattice: Generative Guardrails for Conversational Agents
di: Broadhurst, Emily, et al.
Pubblicazione: (2026)
di: Broadhurst, Emily, et al.
Pubblicazione: (2026)
Decentralized and Lifelong-Adaptive Multi-Agent Collaborative Learning
di: Tang, Shuo, et al.
Pubblicazione: (2024)
di: Tang, Shuo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2023) -
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
di: Wang, Yu, et al.
Pubblicazione: (2024) -
MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
di: Zhang, Yaolun, et al.
Pubblicazione: (2025) -
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
di: Luo, Weidi, et al.
Pubblicazione: (2024) -
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025)