Saved in:
Bibliographic Details
Main Author: Zhang, Ivan
Format: Preprint
Published: 2025
Subjects:
Online Access:https://arxiv.org/abs/2508.07139
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911100591669248
author Zhang, Ivan
author_facet Zhang, Ivan
contents Ensuring LLM alignment is critical to information security as AI models become increasingly widespread and integrated in society. Unfortunately, many defenses against adversarial attacks and jailbreaking on LLMs cannot adapt quickly to new attacks, degrade model responses to benign prompts, or introduce significant barriers to scalable implementation. To mitigate these challenges, we introduce a real-time, self-tuning (RTST) moderator framework to defend against adversarial attacks while maintaining a lightweight training footprint. We empirically evaluate its effectiveness using Google's Gemini models against modern, effective jailbreaks. Our results demonstrate the advantages of an adaptive, minimally intrusive framework for jailbreak defense over traditional fine-tuning or classifier models.
format Preprint
id arxiv_https___arxiv_org_abs_2508_07139
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection
Zhang, Ivan
Cryptography and Security
Artificial Intelligence
Ensuring LLM alignment is critical to information security as AI models become increasingly widespread and integrated in society. Unfortunately, many defenses against adversarial attacks and jailbreaking on LLMs cannot adapt quickly to new attacks, degrade model responses to benign prompts, or introduce significant barriers to scalable implementation. To mitigate these challenges, we introduce a real-time, self-tuning (RTST) moderator framework to defend against adversarial attacks while maintaining a lightweight training footprint. We empirically evaluate its effectiveness using Google's Gemini models against modern, effective jailbreaks. Our results demonstrate the advantages of an adaptive, minimally intrusive framework for jailbreak defense over traditional fine-tuning or classifier models.
title A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection
topic Cryptography and Security
Artificial Intelligence
url https://arxiv.org/abs/2508.07139