Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Giarrusso, Francesco, Sorokoletova, Olga E., Suriani, Vincenzo, Nardi, Daniele |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
par: Bisconti, Piercosma, et autres
Publié: (2025)
par: Bisconti, Piercosma, et autres
Publié: (2025)
Learning from Mistakes: Can LLM Self-Recover after Misalignment?
par: Sorokoletova, Olga E., et autres
Publié: (2026)
par: Sorokoletova, Olga E., et autres
Publié: (2026)
From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda
par: Bisconti, Piercosma, et autres
Publié: (2025)
par: Bisconti, Piercosma, et autres
Publié: (2025)
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs
par: Syrnikov, Marcantonio Bracale, et autres
Publié: (2026)
par: Syrnikov, Marcantonio Bracale, et autres
Publié: (2026)
Metaphor Is Not All Attention Needs
par: Sorokoletova, Olga, et autres
Publié: (2026)
par: Sorokoletova, Olga, et autres
Publié: (2026)
LLM Based Multi-Agent Generation of Semi-structured Documents from Semantic Templates in the Public Administration Domain
par: Musumeci, Emanuele, et autres
Publié: (2024)
par: Musumeci, Emanuele, et autres
Publié: (2024)
Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
par: Prandi, Matteo, et autres
Publié: (2025)
par: Prandi, Matteo, et autres
Publié: (2025)
ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
par: Aswal, Darpan, et autres
Publié: (2025)
par: Aswal, Darpan, et autres
Publié: (2025)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
par: Oh, Sejoon, et autres
Publié: (2024)
par: Oh, Sejoon, et autres
Publié: (2024)
Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
par: Galisai, Marcello, et autres
Publié: (2026)
par: Galisai, Marcello, et autres
Publié: (2026)
Play Everywhere: A Temporal Logic based Game Environment Independent Approach for Playing Soccer with Robots
par: Suriani, Vincenzo, et autres
Publié: (2024)
par: Suriani, Vincenzo, et autres
Publié: (2024)
Towards a scalable AI-driven framework for data-independent Cyber Threat Intelligence Information Extraction
par: Sorokoletova, Olga, et autres
Publié: (2025)
par: Sorokoletova, Olga, et autres
Publié: (2025)
Institutional AI: A Governance Framework for Distributional AGI Safety
par: Pierucci, Federico, et autres
Publié: (2026)
par: Pierucci, Federico, et autres
Publié: (2026)
WebGuard: Building a Generalizable Guardrail for Web Agents
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
Multi Robot Coordination in Highly Dynamic Environments: Tackling Asymmetric Obstacles and Limited Communication
par: Suriani, Vincenzo, et autres
Publié: (2025)
par: Suriani, Vincenzo, et autres
Publié: (2025)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
par: Wen, Xiaofei, et autres
Publié: (2025)
par: Wen, Xiaofei, et autres
Publié: (2025)
EMPOWER: Embodied Multi-role Open-vocabulary Planning with Online Grounding and Execution
par: Argenziano, Francesco, et autres
Publié: (2024)
par: Argenziano, Francesco, et autres
Publié: (2024)
Multi-Agent Planning Using Visual Language Models
par: Brienza, Michele, et autres
Publié: (2024)
par: Brienza, Michele, et autres
Publié: (2024)
Curriculum-Based Multi-Tier Semantic Exploration via Deep Reinforcement Learning
par: Drid, Abdel Hakim, et autres
Publié: (2025)
par: Drid, Abdel Hakim, et autres
Publié: (2025)
LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models
par: Elesedy, Hayder, et autres
Publié: (2024)
par: Elesedy, Hayder, et autres
Publié: (2024)
OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning
par: Zhu, Boyu, et autres
Publié: (2025)
par: Zhu, Boyu, et autres
Publié: (2025)
Jailbreaking to Jailbreak
par: Kritz, Jeremy, et autres
Publié: (2025)
par: Kritz, Jeremy, et autres
Publié: (2025)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
par: She, Yining, et autres
Publié: (2025)
par: She, Yining, et autres
Publié: (2025)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
Retrieval-Augmented Guardrails for AI-Drafted Patient-Portal Messages: Error Taxonomy Construction and Large-Scale Evaluation
par: Chen, Wenyuan, et autres
Publié: (2025)
par: Chen, Wenyuan, et autres
Publié: (2025)
A Lightweight Explainable Guardrail for Prompt Safety
par: Islam, Md Asiful, et autres
Publié: (2026)
par: Islam, Md Asiful, et autres
Publié: (2026)
Building Guardrails for Large Language Models
par: Dong, Yi, et autres
Publié: (2024)
par: Dong, Yi, et autres
Publié: (2024)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
par: Wei, Zeming, et autres
Publié: (2023)
par: Wei, Zeming, et autres
Publié: (2023)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
Cross-Lingual Jailbreak Detection via Semantic Codebooks
par: Alanova, Shirin, et autres
Publié: (2026)
par: Alanova, Shirin, et autres
Publié: (2026)
Trust-Oriented Adaptive Guardrails for Large Language Models
par: Hu, Jinwei, et autres
Publié: (2024)
par: Hu, Jinwei, et autres
Publié: (2024)
FENCE: A Financial and Multimodal Jailbreak Detection Dataset
par: Kim, Mirae, et autres
Publié: (2026)
par: Kim, Mirae, et autres
Publié: (2026)
FactGuard: Event-Centric and Commonsense-Guided Fake News Detection
par: He, Jing, et autres
Publié: (2025)
par: He, Jing, et autres
Publié: (2025)
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
par: Sun, Albert Yu, et autres
Publié: (2023)
par: Sun, Albert Yu, et autres
Publié: (2023)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
ContiGuard: A Framework for Continual Toxicity Detection Against Evolving Evasive Perturbations
par: Kang, Hankun, et autres
Publié: (2026)
par: Kang, Hankun, et autres
Publié: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
Backprompting: Leveraging Synthetic Production Data for Health Advice Guardrails
par: Cheng, Kellen Tan, et autres
Publié: (2025)
par: Cheng, Kellen Tan, et autres
Publié: (2025)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
Documents similaires
-
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
par: Bisconti, Piercosma, et autres
Publié: (2025) -
Learning from Mistakes: Can LLM Self-Recover after Misalignment?
par: Sorokoletova, Olga E., et autres
Publié: (2026) -
From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda
par: Bisconti, Piercosma, et autres
Publié: (2025) -
Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs
par: Syrnikov, Marcantonio Bracale, et autres
Publié: (2026) -
Metaphor Is Not All Attention Needs
par: Sorokoletova, Olga, et autres
Publié: (2026)