A Lightweight Explainable Guardrail for Prompt Safety
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Islam, Md Asiful, Surdeanu, Mihai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Best of Both Worlds: A Pliable and Generalizable Neuro-Symbolic Approach for Relation Classification
par: Vacareanu, Robert, et autres
Publié: (2024)
par: Vacareanu, Robert, et autres
Publié: (2024)
Towards Realistic Few-Shot Relation Extraction: A New Meta Dataset and Evaluation
par: Alam, Fahmida, et autres
Publié: (2024)
par: Alam, Fahmida, et autres
Publié: (2024)
Finding a Wolf in Sheep's Clothing: Combating Adversarial Text-To-Image Prompts with Text Summarization
par: Cooper, Portia, et autres
Publié: (2024)
par: Cooper, Portia, et autres
Publié: (2024)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
Say Less, Mean More: Leveraging Pragmatics in Retrieval-Augmented Generation
par: Riaz, Haris, et autres
Publié: (2025)
par: Riaz, Haris, et autres
Publié: (2025)
From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context Examples
par: Vacareanu, Robert, et autres
Publié: (2024)
par: Vacareanu, Robert, et autres
Publié: (2024)
Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training
par: Ilin, Aleksei, et autres
Publié: (2025)
par: Ilin, Aleksei, et autres
Publié: (2025)
ELLEN: Extremely Lightly Supervised Learning For Efficient Named Entity Recognition
par: Riaz, Haris, et autres
Publié: (2024)
par: Riaz, Haris, et autres
Publié: (2024)
MorphNLI: A Stepwise Approach to Natural Language Inference Using Text Morphing
par: Negru, Vlad Andrei, et autres
Publié: (2025)
par: Negru, Vlad Andrei, et autres
Publié: (2025)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
par: Sreedhar, Makesh Narsimhan, et autres
Publié: (2025)
Policy-as-Prompt: Turning AI Governance Rules into Guardrails for AI Agents
par: Kholkar, Gauri, et autres
Publié: (2025)
par: Kholkar, Gauri, et autres
Publié: (2025)
Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety
par: Huang, Wei-Chieh, et autres
Publié: (2025)
par: Huang, Wei-Chieh, et autres
Publié: (2025)
Memorization in In-Context Learning
par: Golchin, Shahriar, et autres
Publié: (2024)
par: Golchin, Shahriar, et autres
Publié: (2024)
CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety
par: An, Heajun, et autres
Publié: (2026)
par: An, Heajun, et autres
Publié: (2026)
Why Do Safety Guardrails Degrade Across Languages?
par: Zhang, Max, et autres
Publié: (2026)
par: Zhang, Max, et autres
Publié: (2026)
When and Where Did it Happen? An Encoder-Decoder Model to Identify Scenario Context
par: Noriega-Atala, Enrique, et autres
Publié: (2024)
par: Noriega-Atala, Enrique, et autres
Publié: (2024)
SGuard-v1: Safety Guardrail for Large Language Models
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark
par: Yang, Minglai, et autres
Publié: (2025)
par: Yang, Minglai, et autres
Publié: (2025)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
par: She, Yining, et autres
Publié: (2025)
par: She, Yining, et autres
Publié: (2025)
ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
par: Aswal, Darpan, et autres
Publié: (2025)
par: Aswal, Darpan, et autres
Publié: (2025)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
par: Shahani, Prithviraj Singh, et autres
Publié: (2025)
par: Shahani, Prithviraj Singh, et autres
Publié: (2025)
Enhancing Transformer RNNs with Multiple Temporal Perspectives
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2024)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
par: Krishna, Kundan, et autres
Publié: (2025)
par: Krishna, Kundan, et autres
Publié: (2025)
Building Guardrails for Large Language Models
par: Dong, Yi, et autres
Publié: (2024)
par: Dong, Yi, et autres
Publié: (2024)
PromptTailor: Multi-turn Intent-Aligned Prompt Synthesis for Lightweight LLMs
par: Xu, Yizhou, et autres
Publié: (2025)
par: Xu, Yizhou, et autres
Publié: (2025)
Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
par: Giarrusso, Francesco, et autres
Publié: (2025)
par: Giarrusso, Francesco, et autres
Publié: (2025)
Arabic Sentiment Analysis with Noisy Deep Explainable Model
par: Atabuzzaman, Md., et autres
Publié: (2023)
par: Atabuzzaman, Md., et autres
Publié: (2023)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
par: Oh, Sejoon, et autres
Publié: (2024)
par: Oh, Sejoon, et autres
Publié: (2024)
Trust-Oriented Adaptive Guardrails for Large Language Models
par: Hu, Jinwei, et autres
Publié: (2024)
par: Hu, Jinwei, et autres
Publié: (2024)
L-TUNING: Synchronized Label Tuning for Prompt and Prefix in LLMs
par: Kowsher, Md., et autres
Publié: (2023)
par: Kowsher, Md., et autres
Publié: (2023)
LuxVeri at GenAI Detection Task 3: Cross-Domain Detection of AI-Generated Text Using Inverse Perplexity-Weighted Ensemble of Fine-Tuned Transformer Models
par: Mobin, Md Kamrujjaman, et autres
Publié: (2025)
par: Mobin, Md Kamrujjaman, et autres
Publié: (2025)
LuxVeri at GenAI Detection Task 1: Inverse Perplexity Weighted Ensemble for Robust Detection of AI-Generated Text across English and Multilingual Contexts
par: Mobin, Md Kamrujjaman, et autres
Publié: (2025)
par: Mobin, Md Kamrujjaman, et autres
Publié: (2025)
CopySpec: Accelerating LLMs with Speculative Copy-and-Paste Without Compromising Quality
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
par: Dumitru, Razvan-Gabriel, et autres
Publié: (2025)
Backprompting: Leveraging Synthetic Production Data for Health Advice Guardrails
par: Cheng, Kellen Tan, et autres
Publié: (2025)
par: Cheng, Kellen Tan, et autres
Publié: (2025)
Explainable Rule Application via Structured Prompting: A Neural-Symbolic Approach
par: Sadowski, Albert, et autres
Publié: (2025)
par: Sadowski, Albert, et autres
Publié: (2025)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
par: Saky, S M Asiful Islam, et autres
Publié: (2025)
par: Saky, S M Asiful Islam, et autres
Publié: (2025)
Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
par: Gueorguieva, Anna-Maria, et autres
Publié: (2025)
Documents similaires
-
Best of Both Worlds: A Pliable and Generalizable Neuro-Symbolic Approach for Relation Classification
par: Vacareanu, Robert, et autres
Publié: (2024) -
Towards Realistic Few-Shot Relation Extraction: A New Meta Dataset and Evaluation
par: Alam, Fahmida, et autres
Publié: (2024) -
Finding a Wolf in Sheep's Clothing: Combating Adversarial Text-To-Image Prompts with Text Summarization
par: Cooper, Portia, et autres
Publié: (2024) -
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023) -
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)