MAD-MAX: Modular And Diverse Malicious Attack MiXtures for Automated LLM Red Teaming
Fuente:
arXiv
Guardado en:
| Autores principales: | Schoepf, Stefan, Hameed, Muhammad Zaid, Rawat, Ambrish, Fraser, Kieran, Zizzo, Giulio, Cornacchia, Giandomenico, Purcell, Mark |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
por: Rawat, Ambrish, et al.
Publicado: (2024)
por: Rawat, Ambrish, et al.
Publicado: (2024)
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
por: Zizzo, Giulio, et al.
Publicado: (2025)
por: Zizzo, Giulio, et al.
Publicado: (2025)
Domain Adaptation for Time series Transformers using One-step fine-tuning
por: Khanal, Subina, et al.
Publicado: (2024)
por: Khanal, Subina, et al.
Publicado: (2024)
Granite Guardian
por: Padhi, Inkit, et al.
Publicado: (2024)
por: Padhi, Inkit, et al.
Publicado: (2024)
Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
por: Morasso, Cristian, et al.
Publicado: (2026)
por: Morasso, Cristian, et al.
Publicado: (2026)
Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
por: Morasso, Cristian, et al.
Publicado: (2026)
por: Morasso, Cristian, et al.
Publicado: (2026)
Blue Teaming Function-Calling Agents
por: Dolcetti, Greta, et al.
Publicado: (2026)
por: Dolcetti, Greta, et al.
Publicado: (2026)
Activated LoRA: Fine-tuned LLMs for Intrinsics
por: Greenewald, Kristjan, et al.
Publicado: (2025)
por: Greenewald, Kristjan, et al.
Publicado: (2025)
Towards a Practical Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via Randomized Smoothing
por: Gibert, Daniel, et al.
Publicado: (2023)
por: Gibert, Daniel, et al.
Publicado: (2023)
Towards Assurance of LLM Adversarial Robustness using Ontology-Driven Argumentation
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
Developing Assurance Cases for Adversarial Robustness and Regulatory Compliance in LLMs
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
Knowledge-Augmented Reasoning for EUAIA Compliance and Adversarial Robustness of LLMs
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
Towards Assuring EU AI Act Compliance and Adversarial Robustness of LLMs
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
por: Momcilovic, Tomas Bueno, et al.
Publicado: (2024)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
por: Horal, Artur, et al.
Publicado: (2025)
por: Horal, Artur, et al.
Publicado: (2025)
A Robust Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via (De)Randomized Smoothing
por: Gibert, Daniel, et al.
Publicado: (2024)
por: Gibert, Daniel, et al.
Publicado: (2024)
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
por: Duan, Zenghao, et al.
Publicado: (2026)
por: Duan, Zenghao, et al.
Publicado: (2026)
Differentially Private and Adversarially Robust Machine Learning: An Empirical Evaluation
por: Thakkar, Janvi, et al.
Publicado: (2024)
por: Thakkar, Janvi, et al.
Publicado: (2024)
HarmLevelBench: Evaluating Harm-Level Compliance and the Impact of Quantization on Model Alignment
por: Belkhiter, Yannis, et al.
Publicado: (2024)
por: Belkhiter, Yannis, et al.
Publicado: (2024)
Elevating Defenses: Bridging Adversarial Training and Watermarking for Model Resilience
por: Thakkar, Janvi, et al.
Publicado: (2023)
por: Thakkar, Janvi, et al.
Publicado: (2023)
Automated Progressive Red Teaming
por: Jiang, Bojian, et al.
Publicado: (2024)
por: Jiang, Bojian, et al.
Publicado: (2024)
Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
por: Belkhiter, Yannis, et al.
Publicado: (2026)
por: Belkhiter, Yannis, et al.
Publicado: (2026)
Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models
por: Wang, Ren-Jian, et al.
Publicado: (2025)
por: Wang, Ren-Jian, et al.
Publicado: (2025)
The Automation Advantage in AI Red Teaming
por: Mulla, Rob, et al.
Publicado: (2025)
por: Mulla, Rob, et al.
Publicado: (2025)
Both Automation and Paper.
por: Purcell, Royal
Publicado: (1988)
por: Purcell, Royal
Publicado: (1988)
WANTED: Fully Automated Indexing.
por: Purcell, Royal
Publicado: (1991)
por: Purcell, Royal
Publicado: (1991)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
por: Hung, Kuo-Han, et al.
Publicado: (2024)
por: Hung, Kuo-Han, et al.
Publicado: (2024)
Underrepresentation, Label Bias, and Proxies: Towards Data Bias Profiles for the EU AI Act and Beyond
por: Ceccon, Marina, et al.
Publicado: (2025)
por: Ceccon, Marina, et al.
Publicado: (2025)
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
por: Zhou, Andy, et al.
Publicado: (2025)
por: Zhou, Andy, et al.
Publicado: (2025)
Verifiability and Privacy in Federated Learning through Context-Hiding Multi-Key Homomorphic Authenticators
por: Bottoni, Simone, et al.
Publicado: (2025)
por: Bottoni, Simone, et al.
Publicado: (2025)
A Reward-driven Automated Webshell Malicious-code Generator for Red-teaming
por: Ding, Yizhong
Publicado: (2025)
por: Ding, Yizhong
Publicado: (2025)
RedCoder: Automated Multi-Turn Red Teaming for Code LLMs
por: Mo, Wenjie Jacky, et al.
Publicado: (2025)
por: Mo, Wenjie Jacky, et al.
Publicado: (2025)
The Securitisation of Environmental Sustainability and its Critical Geopolitics
por: Ambrish Dhaka
Publicado: (2023)
por: Ambrish Dhaka
Publicado: (2023)
Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation
por: Rousseau, Cécile, et al.
Publicado: (2025)
por: Rousseau, Cécile, et al.
Publicado: (2025)
Red Teaming AI Red Teaming
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
por: Majumdar, Subhabrata, et al.
Publicado: (2025)
Adaptive Instruction Composition for Automated LLM Red-Teaming
por: Zymet, Jesse, et al.
Publicado: (2026)
por: Zymet, Jesse, et al.
Publicado: (2026)
Anecdoctoring: Automated Red-Teaming Across Language and Place
por: Cuevas, Alejandro, et al.
Publicado: (2025)
por: Cuevas, Alejandro, et al.
Publicado: (2025)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
por: Freenor, Michael, et al.
Publicado: (2025)
por: Freenor, Michael, et al.
Publicado: (2025)
RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models
por: Ding, Jiale, et al.
Publicado: (2025)
por: Ding, Jiale, et al.
Publicado: (2025)
Ejemplares similares
-
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
por: Cornacchia, Giandomenico, et al.
Publicado: (2024) -
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
por: Rawat, Ambrish, et al.
Publicado: (2024) -
Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs
por: Zizzo, Giulio, et al.
Publicado: (2025) -
Domain Adaptation for Time series Transformers using One-step fine-tuning
por: Khanal, Subina, et al.
Publicado: (2024) -
Granite Guardian
por: Padhi, Inkit, et al.
Publicado: (2024)