HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mazeika, Mantas, Phan, Long, Yin, Xuwang, Zou, Andy, Wang, Zifan, Mu, Norman, Sakhaee, Elham, Li, Nathaniel, Basart, Steven, Li, Bo, Forsyth, David, Hendrycks, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TextQuests: How Good are LLMs at Text-Based Video Games?
par: Phan, Long, et autres
Publié: (2025)
par: Phan, Long, et autres
Publié: (2025)
Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
par: Mazeika, Mantas, et autres
Publié: (2025)
par: Mazeika, Mantas, et autres
Publié: (2025)
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024)
par: Ren, Richard, et autres
Publié: (2024)
Representation Engineering: A Top-Down Approach to AI Transparency
par: Zou, Andy, et autres
Publié: (2023)
par: Zou, Andy, et autres
Publié: (2023)
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
par: Cobben, Pepijn, et autres
Publié: (2026)
par: Cobben, Pepijn, et autres
Publié: (2026)
Tamper-Resistant Safeguards for Open-Weight LLMs
par: Tamirisa, Rishub, et autres
Publié: (2024)
par: Tamirisa, Rishub, et autres
Publié: (2024)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
par: Dimino, Fabrizio, et autres
Publié: (2026)
par: Dimino, Fabrizio, et autres
Publié: (2026)
Aggressive Compression Enables LLM Weight Theft
par: Brown, Davis, et autres
Publié: (2026)
par: Brown, Davis, et autres
Publié: (2026)
The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
par: Ren, Richard, et autres
Publié: (2025)
par: Ren, Richard, et autres
Publié: (2025)
LLMs Encode Harmfulness and Refusal Separately
par: Zhao, Jiachen, et autres
Publié: (2025)
par: Zhao, Jiachen, et autres
Publié: (2025)
Adaptive Instruction Composition for Automated LLM Red-Teaming
par: Zymet, Jesse, et autres
Publié: (2026)
par: Zymet, Jesse, et autres
Publié: (2026)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Automated Progressive Red Teaming
par: Jiang, Bojian, et autres
Publié: (2024)
par: Jiang, Bojian, et autres
Publié: (2024)
Should LLM Safety Be More Than Refusing Harmful Instructions?
par: Maskey, Utsav, et autres
Publié: (2025)
par: Maskey, Utsav, et autres
Publié: (2025)
Anecdoctoring: Automated Red-Teaming Across Language and Place
par: Cuevas, Alejandro, et autres
Publié: (2025)
par: Cuevas, Alejandro, et autres
Publié: (2025)
Can LLMs Follow Simple Rules?
par: Mu, Norman, et autres
Publié: (2023)
par: Mu, Norman, et autres
Publié: (2023)
Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models
par: Van Doren, Madison, et autres
Publié: (2025)
par: Van Doren, Madison, et autres
Publié: (2025)
RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models
par: Dang, Quy-Anh, et autres
Publié: (2026)
par: Dang, Quy-Anh, et autres
Publié: (2026)
Effective Automation to Support the Human Infrastructure in AI Red Teaming
par: Zhang, Alice Qian, et autres
Publié: (2025)
par: Zhang, Alice Qian, et autres
Publié: (2025)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
par: Han, Vernon Toh Yan, et autres
Publié: (2024)
par: Han, Vernon Toh Yan, et autres
Publié: (2024)
"Even GPT Can Reject Me": Conceptualizing Abrupt Refusal Secondary Harm (ARSH) and Reimagining Psychological AI Safety with Compassionate Completion Standard (CCS)
par: Ni, Yang, et autres
Publié: (2025)
par: Ni, Yang, et autres
Publié: (2025)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
Improving Alignment and Robustness with Circuit Breakers
par: Zou, Andy, et autres
Publié: (2024)
par: Zou, Andy, et autres
Publié: (2024)
Red Teaming Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation
par: Quaye, Jessica, et autres
Publié: (2024)
par: Quaye, Jessica, et autres
Publié: (2024)
Multi-lingual Multi-turn Automated Red Teaming for LLMs
par: Singhania, Abhishek, et autres
Publié: (2025)
par: Singhania, Abhishek, et autres
Publié: (2025)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
par: An, Bang, et autres
Publié: (2024)
par: An, Bang, et autres
Publié: (2024)
Prompt Optimization and Evaluation for LLM Automated Red Teaming
par: Freenor, Michael, et autres
Publié: (2025)
par: Freenor, Michael, et autres
Publié: (2025)
STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming
par: Jung, MinJae, et autres
Publié: (2026)
par: Jung, MinJae, et autres
Publié: (2026)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
par: Wei, Zhang, et autres
Publié: (2025)
par: Wei, Zhang, et autres
Publié: (2025)
Introduction to AI Safety, Ethics, and Society
par: Hendrycks, Dan
Publié: (2024)
par: Hendrycks, Dan
Publié: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
par: Cui, Justin, et autres
Publié: (2024)
par: Cui, Justin, et autres
Publié: (2024)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
Where Do Reasoning Models Refuse?
par: Yamaguchi, Kureha, et autres
Publié: (2025)
par: Yamaguchi, Kureha, et autres
Publié: (2025)
Red Teaming AI Red Teaming
par: Majumdar, Subhabrata, et autres
Publié: (2025)
par: Majumdar, Subhabrata, et autres
Publié: (2025)
Training a General Purpose Automated Red Teaming Model
par: Padmakumar, Aishwarya, et autres
Publié: (2026)
par: Padmakumar, Aishwarya, et autres
Publié: (2026)
Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark
par: Götting, Jasper, et autres
Publié: (2025)
par: Götting, Jasper, et autres
Publié: (2025)
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
par: Ren, Kaixuan, et autres
Publié: (2025)
par: Ren, Kaixuan, et autres
Publié: (2025)
FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)
par: Priyanshu, Aman, et autres
Publié: (2024)
par: Priyanshu, Aman, et autres
Publié: (2024)
Against The Achilles' Heel: A Survey on Red Teaming for Generative Models
par: Lin, Lizhi, et autres
Publié: (2024)
par: Lin, Lizhi, et autres
Publié: (2024)
Documents similaires
-
TextQuests: How Good are LLMs at Text-Based Video Games?
par: Phan, Long, et autres
Publié: (2025) -
Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
par: Mazeika, Mantas, et autres
Publié: (2025) -
Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?
par: Ren, Richard, et autres
Publié: (2024) -
Representation Engineering: A Top-Down Approach to AI Transparency
par: Zou, Andy, et autres
Publié: (2023) -
GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
par: Cobben, Pepijn, et autres
Publié: (2026)