A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhang, Ivan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025)
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025)
Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
di: Lin, Lixing, et al.
Pubblicazione: (2026)
di: Lin, Lixing, et al.
Pubblicazione: (2026)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
SEASONED: Semantic-Enhanced Self-Counterfactual Explainable Detection of Adversarial Exploiter Contracts
di: Ai, Xng, et al.
Pubblicazione: (2025)
di: Ai, Xng, et al.
Pubblicazione: (2025)
Adversarial-Resilient RF Fingerprinting: A CNN-GAN Framework for Rogue Transmitter Detection
di: Dhakal, Raju, et al.
Pubblicazione: (2025)
di: Dhakal, Raju, et al.
Pubblicazione: (2025)
RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework
di: Ikbarieh, Seif, et al.
Pubblicazione: (2025)
di: Ikbarieh, Seif, et al.
Pubblicazione: (2025)
Democratizing ML for Enterprise Security: A Self-Sustained Attack Detection Framework
di: Momeni, Sadegh, et al.
Pubblicazione: (2025)
di: Momeni, Sadegh, et al.
Pubblicazione: (2025)
In-Browser LLM-Guided Fuzzing for Real-Time Prompt Injection Testing in Agentic AI Browsers
di: Cohen, Avihay
Pubblicazione: (2025)
di: Cohen, Avihay
Pubblicazione: (2025)
MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber
di: Bhardwaj, Arth, et al.
Pubblicazione: (2025)
di: Bhardwaj, Arth, et al.
Pubblicazione: (2025)
Masked Language Model Based Textual Adversarial Example Detection
di: Zhang, Xiaomei, et al.
Pubblicazione: (2023)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2023)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
di: Cao, Tri, et al.
Pubblicazione: (2026)
di: Cao, Tri, et al.
Pubblicazione: (2026)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
di: Chang, Chen-Wei, et al.
Pubblicazione: (2025)
di: Chang, Chen-Wei, et al.
Pubblicazione: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
Advanced Real-Time Fraud Detection Using RAG-Based LLMs
di: Singh, Gurjot, et al.
Pubblicazione: (2025)
di: Singh, Gurjot, et al.
Pubblicazione: (2025)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
di: Xue, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xue, Xiaoyu, et al.
Pubblicazione: (2025)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
LumiMAS: A Comprehensive Framework for Real-Time Monitoring and Enhanced Observability in Multi-Agent Systems
di: Solomon, Ron, et al.
Pubblicazione: (2025)
di: Solomon, Ron, et al.
Pubblicazione: (2025)
I Don't Know You, But I Can Catch You: Real-Time Defense against Diverse Adversarial Patches for Object Detectors
di: Lin, Zijin, et al.
Pubblicazione: (2024)
di: Lin, Zijin, et al.
Pubblicazione: (2024)
Detecting Adversarial Fine-tuning with Auditing Agents
di: Egler, Sarah, et al.
Pubblicazione: (2025)
di: Egler, Sarah, et al.
Pubblicazione: (2025)
LogSHIELD: A Graph-based Real-time Anomaly Detection Framework using Frequency Analysis
di: Roy, Krishna Chandra, et al.
Pubblicazione: (2024)
di: Roy, Krishna Chandra, et al.
Pubblicazione: (2024)
A Novel and Practical Universal Adversarial Perturbations against Deep Reinforcement Learning based Intrusion Detection Systems
di: Zhang, H., et al.
Pubblicazione: (2025)
di: Zhang, H., et al.
Pubblicazione: (2025)
AI-Powered Anomaly Detection with Blockchain for Real-Time Security and Reliability in Autonomous Vehicles
di: Shit, Rathin Chandra, et al.
Pubblicazione: (2025)
di: Shit, Rathin Chandra, et al.
Pubblicazione: (2025)
ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction
di: Wang, Che, et al.
Pubblicazione: (2026)
di: Wang, Che, et al.
Pubblicazione: (2026)
Unified Threat Detection and Mitigation Framework (UTDMF): Combating Prompt Injection, Deception, and Bias in Enterprise-Scale Transformers
di: KumarRavindran, Santhosh
Pubblicazione: (2025)
di: KumarRavindran, Santhosh
Pubblicazione: (2025)
Code Vulnerability Repair with Large Language Model using Context-Aware Prompt Tuning
di: Khan, Arshiya, et al.
Pubblicazione: (2024)
di: Khan, Arshiya, et al.
Pubblicazione: (2024)
Self-interpreting Adversarial Images
di: Zhang, Tingwei, et al.
Pubblicazione: (2024)
di: Zhang, Tingwei, et al.
Pubblicazione: (2024)
Integrated Simulation Framework for Adversarial Attacks on Autonomous Vehicles
di: Anagnostopoulos, Christos, et al.
Pubblicazione: (2025)
di: Anagnostopoulos, Christos, et al.
Pubblicazione: (2025)
Adversarial Attacks against Windows PE Malware Detection: A Survey of the State-of-the-Art
di: Ling, Xiang, et al.
Pubblicazione: (2021)
di: Ling, Xiang, et al.
Pubblicazione: (2021)
FAST-IDS: A Fast Two-Stage Intrusion Detection System with Hybrid Compression for Real-Time Threat Detection in Connected and Autonomous Vehicles
di: S, Devika, et al.
Pubblicazione: (2025)
di: S, Devika, et al.
Pubblicazione: (2025)
Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System
di: Dobrovolskyi, Ivan
Pubblicazione: (2026)
di: Dobrovolskyi, Ivan
Pubblicazione: (2026)
Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack
di: Kang, Daewon, et al.
Pubblicazione: (2025)
di: Kang, Daewon, et al.
Pubblicazione: (2025)
DataSentinel: A Game-Theoretic Detection of Prompt Injection Attacks
di: Liu, Yupei, et al.
Pubblicazione: (2025)
di: Liu, Yupei, et al.
Pubblicazione: (2025)
Adversarial Evasion in Non-Stationary Malware Detection: Minimizing Drift Signals through Similarity-Constrained Perturbations
di: Acharya, Pawan, et al.
Pubblicazione: (2026)
di: Acharya, Pawan, et al.
Pubblicazione: (2026)
FTSmartAudit: A Knowledge Distillation-Enhanced Framework for Automated Smart Contract Auditing Using Fine-Tuned LLMs
di: Wei, Zhiyuan, et al.
Pubblicazione: (2024)
di: Wei, Zhiyuan, et al.
Pubblicazione: (2024)
Adversarial Defense in Cybersecurity: A Systematic Review of GANs for Threat Detection and Mitigation
di: Ndayipfukamiye, Tharcisse, et al.
Pubblicazione: (2025)
di: Ndayipfukamiye, Tharcisse, et al.
Pubblicazione: (2025)
ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection
di: Zhao, Wei, et al.
Pubblicazione: (2026)
di: Zhao, Wei, et al.
Pubblicazione: (2026)
Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
di: Kulkarni, Prashant
Pubblicazione: (2026)
di: Kulkarni, Prashant
Pubblicazione: (2026)
Prompt Inject Detection with Generative Explanation as an Investigative Tool
di: Pan, Jonathan, et al.
Pubblicazione: (2025)
di: Pan, Jonathan, et al.
Pubblicazione: (2025)
Defending against Indirect Prompt Injection by Instruction Detection
di: Wen, Tongyu, et al.
Pubblicazione: (2025)
di: Wen, Tongyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
di: Hasan, Md. Mehedi, et al.
Pubblicazione: (2025) -
Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
di: Lin, Lixing, et al.
Pubblicazione: (2026) -
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024) -
SEASONED: Semantic-Enhanced Self-Counterfactual Explainable Detection of Adversarial Exploiter Contracts
di: Ai, Xng, et al.
Pubblicazione: (2025) -
Adversarial-Resilient RF Fingerprinting: A CNN-GAN Framework for Rogue Transmitter Detection
di: Dhakal, Raju, et al.
Pubblicazione: (2025)