AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Andy, Wu, Kevin, Pinto, Francesco, Chen, Zhaorun, Zeng, Yi, Yang, Yu, Yang, Shuang, Koyejo, Sanmi, Zou, James, Li, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Autonomous Adversary: Red-Teaming in the age of LLM
di: Mamun, Mohammad, et al.
Pubblicazione: (2026)
di: Mamun, Mohammad, et al.
Pubblicazione: (2026)
Automated Progressive Red Teaming
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
di: Jiang, Bojian, et al.
Pubblicazione: (2024)
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
di: Zhang, Jiawei, et al.
Pubblicazione: (2025)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
di: Horal, Artur, et al.
Pubblicazione: (2025)
di: Horal, Artur, et al.
Pubblicazione: (2025)
Invariant Aggregator for Defending against Federated Backdoor Attacks
di: Wang, Xiaoyang, et al.
Pubblicazione: (2022)
di: Wang, Xiaoyang, et al.
Pubblicazione: (2022)
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
di: Duan, Zenghao, et al.
Pubblicazione: (2026)
Red-Teaming LLM Multi-Agent Systems via Communication Attacks
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
Red Teaming Large Reasoning Models
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
Red Teaming AI Red Teaming
di: Majumdar, Subhabrata, et al.
Pubblicazione: (2025)
di: Majumdar, Subhabrata, et al.
Pubblicazione: (2025)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
Red Teaming Methodology for Design Obfuscation
di: Liu, Yuntao, et al.
Pubblicazione: (2025)
di: Liu, Yuntao, et al.
Pubblicazione: (2025)
Distributional Machine Unlearning via Selective Data Removal
di: Allouah, Youssef, et al.
Pubblicazione: (2025)
di: Allouah, Youssef, et al.
Pubblicazione: (2025)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
Incalmo: An Autonomous LLM-assisted System for Red Teaming Multi-Host Networks
di: Singer, Brian, et al.
Pubblicazione: (2025)
di: Singer, Brian, et al.
Pubblicazione: (2025)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
di: Xu, Huiyu, et al.
Pubblicazione: (2024)
AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
Unraveling the Connections between Privacy and Certified Robustness in Federated Learning Against Poisoning Attacks
di: Xie, Chulin, et al.
Pubblicazione: (2022)
di: Xie, Chulin, et al.
Pubblicazione: (2022)
From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
di: Sinha, Anusha, et al.
Pubblicazione: (2025)
Leveraging Reinforcement Learning in Red Teaming for Advanced Ransomware Attack Simulations
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025)
di: Gao, Haoran, et al.
Pubblicazione: (2025)
Demo: ViolentUTF as An Accessible Platform for Generative AI Red Teaming
di: Nguyen, Tam n.
Pubblicazione: (2025)
di: Nguyen, Tam n.
Pubblicazione: (2025)
MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
di: Syros, Georgios, et al.
Pubblicazione: (2026)
di: Syros, Georgios, et al.
Pubblicazione: (2026)
AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models
di: Gautam, Tanmay, et al.
Pubblicazione: (2026)
di: Gautam, Tanmay, et al.
Pubblicazione: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
Adaptive Instruction Composition for Automated LLM Red-Teaming
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
di: Zymet, Jesse, et al.
Pubblicazione: (2026)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
di: Liu, Yi, et al.
Pubblicazione: (2024)
di: Liu, Yi, et al.
Pubblicazione: (2024)
When Scanners Lie: Evaluator Instability in LLM Red-Teaming
di: Erez, Lidor, et al.
Pubblicazione: (2026)
di: Erez, Lidor, et al.
Pubblicazione: (2026)
Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
di: Yao, Hongwei, et al.
Pubblicazione: (2026)
di: Yao, Hongwei, et al.
Pubblicazione: (2026)
From Promise to Peril: Rethinking Cybersecurity Red and Blue Teaming in the Age of LLMs
di: Abuadbba, Alsharif, et al.
Pubblicazione: (2025)
di: Abuadbba, Alsharif, et al.
Pubblicazione: (2025)
LAAF: Logic-layer Automated Attack Framework A Systematic Red-Teaming Methodology for LPCI Vulnerabilities in Agentic Large Language Model Systems
di: Atta, Hammad, et al.
Pubblicazione: (2026)
di: Atta, Hammad, et al.
Pubblicazione: (2026)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
di: Freenor, Michael, et al.
Pubblicazione: (2025)
di: Freenor, Michael, et al.
Pubblicazione: (2025)
Red Team Redemption: A Structured Comparison of Open-Source Tools for Adversary Emulation
di: Landauer, Max, et al.
Pubblicazione: (2024)
di: Landauer, Max, et al.
Pubblicazione: (2024)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
di: Wang, Zilong, et al.
Pubblicazione: (2025)
di: Wang, Zilong, et al.
Pubblicazione: (2025)
Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
di: Rawat, Ambrish, et al.
Pubblicazione: (2024)
CyberSleuth: Autonomous Blue-Team LLM Agent for Web Attack Forensics
di: Fumero, Stefano, et al.
Pubblicazione: (2025)
di: Fumero, Stefano, et al.
Pubblicazione: (2025)
FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption
di: Wang, Yanting, et al.
Pubblicazione: (2026)
di: Wang, Yanting, et al.
Pubblicazione: (2026)
A Red Teaming Roadmap Towards System-Level Safety
di: Wang, Zifan, et al.
Pubblicazione: (2025)
di: Wang, Zifan, et al.
Pubblicazione: (2025)
Training a General Purpose Automated Red Teaming Model
di: Padmakumar, Aishwarya, et al.
Pubblicazione: (2026)
di: Padmakumar, Aishwarya, et al.
Pubblicazione: (2026)
MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
di: Jotautaitė, Monika, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
di: Wang, Hao, et al.
Pubblicazione: (2026) -
Autonomous Adversary: Red-Teaming in the age of LLM
di: Mamun, Mohammad, et al.
Pubblicazione: (2026) -
Automated Progressive Red Teaming
di: Jiang, Bojian, et al.
Pubblicazione: (2024) -
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
di: Zhang, Jiawei, et al.
Pubblicazione: (2025) -
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
di: Horal, Artur, et al.
Pubblicazione: (2025)