LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Nanxi, Zhao, Zhengyue, Xiao, Chaowei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
di: Li, Nanxi, et al.
Pubblicazione: (2025)
di: Li, Nanxi, et al.
Pubblicazione: (2025)
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
di: Xu, Peiyang, et al.
Pubblicazione: (2025)
di: Xu, Peiyang, et al.
Pubblicazione: (2025)
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025)
Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation
di: Zafar, Osama, et al.
Pubblicazione: (2026)
di: Zafar, Osama, et al.
Pubblicazione: (2026)
No Free Lunch with Guardrails
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
OET: Optimization-based prompt injection Evaluation Toolkit
di: Pan, Jinsheng, et al.
Pubblicazione: (2025)
di: Pan, Jinsheng, et al.
Pubblicazione: (2025)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
di: Wang, Peiran, et al.
Pubblicazione: (2024)
di: Wang, Peiran, et al.
Pubblicazione: (2024)
A Comparative Evaluation of AI Agent Security Guardrails
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management
di: Wen, Ruoyao, et al.
Pubblicazione: (2026)
di: Wen, Ruoyao, et al.
Pubblicazione: (2026)
Enhancing Guardrails for Safe and Secure Healthcare AI
di: Gangavarapu, Ananya
Pubblicazione: (2024)
di: Gangavarapu, Ananya
Pubblicazione: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
di: Zhao, Zhengyue, et al.
Pubblicazione: (2025)
di: Zhao, Zhengyue, et al.
Pubblicazione: (2025)
Defenses Against Prompt Attacks Learn Surface Heuristics
di: Li, Shawn, et al.
Pubblicazione: (2026)
di: Li, Shawn, et al.
Pubblicazione: (2026)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
di: Nian, Yi, et al.
Pubblicazione: (2025)
di: Nian, Yi, et al.
Pubblicazione: (2025)
Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
di: Luo, Weidi, et al.
Pubblicazione: (2025)
di: Luo, Weidi, et al.
Pubblicazione: (2025)
WIPI: A New Web Threat for LLM-Driven Web Agents
di: Wu, Fangzhou, et al.
Pubblicazione: (2024)
di: Wu, Fangzhou, et al.
Pubblicazione: (2024)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
Cognitive Cybersecurity for Artificial Intelligence: Guardrail Engineering with CCS-7
di: Aydin, Yuksel
Pubblicazione: (2025)
di: Aydin, Yuksel
Pubblicazione: (2025)
Breaking Guardrails, Facing Walls: Insights on Adversarial AI for Defenders & Researchers
di: Bertollo, Giacomo, et al.
Pubblicazione: (2025)
di: Bertollo, Giacomo, et al.
Pubblicazione: (2025)
Balancing Privacy and Efficiency: Music Information Retrieval via Additive Homomorphic Encryption
di: Wang, William Zerong, et al.
Pubblicazione: (2025)
di: Wang, William Zerong, et al.
Pubblicazione: (2025)
LLM Access Shield: Domain-Specific LLM Framework for Privacy Policy Compliance
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
di: Wang, Xi, et al.
Pubblicazione: (2026)
di: Wang, Xi, et al.
Pubblicazione: (2026)
A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems
di: Wu, Fangzhou, et al.
Pubblicazione: (2024)
di: Wu, Fangzhou, et al.
Pubblicazione: (2024)
On Automating Security Policies with Contemporary LLMs
di: Saura, Pablo Fernández, et al.
Pubblicazione: (2025)
di: Saura, Pablo Fernández, et al.
Pubblicazione: (2025)
OneShield -- the Next Generation of LLM Guardrails
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
di: DeLuca, Chad, et al.
Pubblicazione: (2025)
How Good LLM-Generated Password Policies Are?
di: Vaidya, Vivek, et al.
Pubblicazione: (2025)
di: Vaidya, Vivek, et al.
Pubblicazione: (2025)
RAGent: Retrieval-based Access Control Policy Generation
di: Jayasundara, Sakuna Harinda, et al.
Pubblicazione: (2024)
di: Jayasundara, Sakuna Harinda, et al.
Pubblicazione: (2024)
Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks
di: Xiang, Chong, et al.
Pubblicazione: (2026)
di: Xiang, Chong, et al.
Pubblicazione: (2026)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
di: Li, Hao, et al.
Pubblicazione: (2024)
di: Li, Hao, et al.
Pubblicazione: (2024)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
Proof-of-Guardrail in AI Agents and What (Not) to Trust from It
di: Jin, Xisen, et al.
Pubblicazione: (2026)
di: Jin, Xisen, et al.
Pubblicazione: (2026)
NeuroFilter: Privacy Guardrails for Conversational LLM Agents
di: Das, Saswat, et al.
Pubblicazione: (2026)
di: Das, Saswat, et al.
Pubblicazione: (2026)
APEX: Agent Payment Execution with Policy for Autonomous Agent API Access
di: Uddin, Mohd Safwan, et al.
Pubblicazione: (2026)
di: Uddin, Mohd Safwan, et al.
Pubblicazione: (2026)
AudAgent: Automated Auditing of Privacy Policy Compliance in AI Agents
di: Zheng, Ye, et al.
Pubblicazione: (2025)
di: Zheng, Ye, et al.
Pubblicazione: (2025)
A BERT-based Empirical Study of Privacy Policies' Compliance with GDPR
di: Zhang, Lu, et al.
Pubblicazione: (2024)
di: Zhang, Lu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
di: Li, Nanxi, et al.
Pubblicazione: (2025) -
SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability
di: Xu, Peiyang, et al.
Pubblicazione: (2025) -
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
di: Liu, Xiaogeng, et al.
Pubblicazione: (2025) -
Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation
di: Zafar, Osama, et al.
Pubblicazione: (2026) -
No Free Lunch with Guardrails
di: Kumar, Divyanshu, et al.
Pubblicazione: (2025)