MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Cornacchia, Giandomenico, Zizzo, Giulio, Fraser, Kieran, Hameed, Muhammad Zaid, Rawat, Ambrish, Purcell, Mark |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MAD-MAX: Modular And Diverse Malicious Attack MiXtures for Automated LLM Red Teaming
di: Schoepf, Stefan, et al.
Pubblicazione: (2025)
di: Schoepf, Stefan, et al.
Pubblicazione: (2025)
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
di: Zizzo, Giulio, et al.
Pubblicazione: (2025)
di: Zizzo, Giulio, et al.
Pubblicazione: (2025)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
Domain Adaptation for Time series Transformers using One-step fine-tuning
di: Khanal, Subina, et al.
Pubblicazione: (2024)
di: Khanal, Subina, et al.
Pubblicazione: (2024)
Granite Guardian
di: Padhi, Inkit, et al.
Pubblicazione: (2024)
di: Padhi, Inkit, et al.
Pubblicazione: (2024)
Towards Assurance of LLM Adversarial Robustness using Ontology-Driven Argumentation
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
Developing Assurance Cases for Adversarial Robustness and Regulatory Compliance in LLMs
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
Knowledge-Augmented Reasoning for EUAIA Compliance and Adversarial Robustness of LLMs
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
Towards Assuring EU AI Act Compliance and Adversarial Robustness of LLMs
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
di: Momcilovic, Tomas Bueno, et al.
Pubblicazione: (2024)
Activated LoRA: Fine-tuned LLMs for Intrinsics
di: Greenewald, Kristjan, et al.
Pubblicazione: (2025)
di: Greenewald, Kristjan, et al.
Pubblicazione: (2025)
Towards a Practical Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via Randomized Smoothing
di: Gibert, Daniel, et al.
Pubblicazione: (2023)
di: Gibert, Daniel, et al.
Pubblicazione: (2023)
Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
di: Morasso, Cristian, et al.
Pubblicazione: (2026)
di: Morasso, Cristian, et al.
Pubblicazione: (2026)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
di: Morasso, Cristian, et al.
Pubblicazione: (2026)
di: Morasso, Cristian, et al.
Pubblicazione: (2026)
Pre-Hoc Predictions in AutoML: Leveraging LLMs to Enhance Model Selection and Benchmarking for Tabular datasets
di: Belkhiter, Yannis, et al.
Pubblicazione: (2025)
di: Belkhiter, Yannis, et al.
Pubblicazione: (2025)
A Robust Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via (De)Randomized Smoothing
di: Gibert, Daniel, et al.
Pubblicazione: (2024)
di: Gibert, Daniel, et al.
Pubblicazione: (2024)
ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack
di: Park, Yein, et al.
Pubblicazione: (2025)
di: Park, Yein, et al.
Pubblicazione: (2025)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
CourtGuard: A Local, Multiagent Prompt Injection Classifier
di: Wu, Isaac, et al.
Pubblicazione: (2025)
di: Wu, Isaac, et al.
Pubblicazione: (2025)
Differentially Private and Adversarially Robust Machine Learning: An Empirical Evaluation
di: Thakkar, Janvi, et al.
Pubblicazione: (2024)
di: Thakkar, Janvi, et al.
Pubblicazione: (2024)
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
di: Belkhiter, Yannis, et al.
Pubblicazione: (2024)
di: Belkhiter, Yannis, et al.
Pubblicazione: (2024)
Blue Teaming Function-Calling Agents
di: Dolcetti, Greta, et al.
Pubblicazione: (2026)
di: Dolcetti, Greta, et al.
Pubblicazione: (2026)
Elevating Defenses: Bridging Adversarial Training and Watermarking for Model Resilience
di: Thakkar, Janvi, et al.
Pubblicazione: (2023)
di: Thakkar, Janvi, et al.
Pubblicazione: (2023)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2024)
Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
di: Belkhiter, Yannis, et al.
Pubblicazione: (2026)
di: Belkhiter, Yannis, et al.
Pubblicazione: (2026)
PT-MoE: An Efficient Finetuning Framework for Integrating Mixture-of-Experts into Prompt Tuning
di: Li, Zongqian, et al.
Pubblicazione: (2025)
di: Li, Zongqian, et al.
Pubblicazione: (2025)
Federated Learning with Discriminative Naive Bayes Classifier
di: Torrijos, Pablo, et al.
Pubblicazione: (2025)
di: Torrijos, Pablo, et al.
Pubblicazione: (2025)
Structure of Classifier Boundaries: Case Study for a Naive Bayes Classifier
di: Karr, Alan F., et al.
Pubblicazione: (2022)
di: Karr, Alan F., et al.
Pubblicazione: (2022)
MoEcho: Exploiting Side-Channel Attacks to Compromise User Privacy in Mixture-of-Experts LLMs
di: Ding, Ruyi, et al.
Pubblicazione: (2025)
di: Ding, Ruyi, et al.
Pubblicazione: (2025)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
$\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
di: Takashiro, Shota, et al.
Pubblicazione: (2026)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
DecipherGuard: Understanding and Deciphering Jailbreak Prompts for a Safer Deployment of Intelligent Software Systems
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
Underrepresentation, Label Bias, and Proxies: Towards Data Bias Profiles for the EU AI Act and Beyond
di: Ceccon, Marina, et al.
Pubblicazione: (2025)
di: Ceccon, Marina, et al.
Pubblicazione: (2025)
MoFE: Mixture of Frozen Experts Architecture
di: Seo, Jean, et al.
Pubblicazione: (2025)
di: Seo, Jean, et al.
Pubblicazione: (2025)
MoDEM: Mixture of Domain Expert Models
di: Simonds, Toby, et al.
Pubblicazione: (2024)
di: Simonds, Toby, et al.
Pubblicazione: (2024)
MoWE : A Mixture of Weather Experts
di: Chakraborty, Dibyajyoti, et al.
Pubblicazione: (2025)
di: Chakraborty, Dibyajyoti, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MAD-MAX: Modular And Diverse Malicious Attack MiXtures for Automated LLM Red Teaming
di: Schoepf, Stefan, et al.
Pubblicazione: (2025) -
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
di: Zizzo, Giulio, et al.
Pubblicazione: (2025) -
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
di: Rawat, Ambrish, et al.
Pubblicazione: (2024) -
Domain Adaptation for Time series Transformers using One-step fine-tuning
di: Khanal, Subina, et al.
Pubblicazione: (2024) -
Granite Guardian
di: Padhi, Inkit, et al.
Pubblicazione: (2024)