AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Andriushchenko, Maksym, Souly, Alexandra, Dziemian, Mateusz, Duenas, Derek, Lin, Maxwell, Wang, Justin, Hendrycks, Dan, Zou, Andy, Kolter, Zico, Fredrikson, Matt, Winsor, Eric, Wynne, Jerome, Gal, Yarin, Davies, Xander |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Alignment and Robustness with Circuit Breakers
par: Zou, Andy, et autres
Publié: (2024)
par: Zou, Andy, et autres
Publié: (2024)
Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition
par: Zou, Andy, et autres
Publié: (2025)
par: Zou, Andy, et autres
Publié: (2025)
OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents
par: Kuntz, Thomas, et autres
Publié: (2025)
par: Kuntz, Thomas, et autres
Publié: (2025)
Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs
par: Davies, Xander, et autres
Publié: (2025)
par: Davies, Xander, et autres
Publié: (2025)
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025)
par: Sam, Dylan, et autres
Publié: (2025)
Boundary Point Jailbreaking of Black-Box LLMs
par: Davies, Xander, et autres
Publié: (2026)
par: Davies, Xander, et autres
Publié: (2026)
D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models
par: Krishna, Satyapriya, et autres
Publié: (2025)
par: Krishna, Satyapriya, et autres
Publié: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
par: Feng, Zhili, et autres
Publié: (2025)
par: Feng, Zhili, et autres
Publié: (2025)
How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition
par: Dziemian, Mateusz, et autres
Publié: (2026)
par: Dziemian, Mateusz, et autres
Publié: (2026)
Applying Refusal-Vector Ablation to Llama 3.1 70B Agents
par: Lermen, Simon, et autres
Publié: (2024)
par: Lermen, Simon, et autres
Publié: (2024)
RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents
par: Guo, Chengquan, et autres
Publié: (2025)
par: Guo, Chengquan, et autres
Publié: (2025)
Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents
par: Bazinska, Julia, et autres
Publié: (2025)
par: Bazinska, Julia, et autres
Publié: (2025)
Adversarial Attacks on Robotic Vision Language Action Models
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
Agent Skills Enable a New Class of Realistic and Trivially Simple Prompt Injections
par: Schmotz, David, et autres
Publié: (2025)
par: Schmotz, David, et autres
Publié: (2025)
Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
par: Lin, Justin W., et autres
Publié: (2025)
par: Lin, Justin W., et autres
Publié: (2025)
Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors
par: Wiedermann-Möller, Jonas, et autres
Publié: (2026)
par: Wiedermann-Möller, Jonas, et autres
Publié: (2026)
Can a Bayesian Oracle Prevent Harm from an Agent?
par: Bengio, Yoshua, et autres
Publié: (2024)
par: Bengio, Yoshua, et autres
Publié: (2024)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
par: Jiang, Yukun, et autres
Publié: (2026)
par: Jiang, Yukun, et autres
Publié: (2026)
Measuring Harmfulness of Computer-Using Agents
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate
par: Zhu, Shenzhe
Publié: (2025)
par: Zhu, Shenzhe
Publié: (2025)
Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks
par: Schmotz, David, et autres
Publié: (2026)
par: Schmotz, David, et autres
Publié: (2026)
Safety Pretraining: Toward the Next Generation of Safe AI
par: Maini, Pratyush, et autres
Publié: (2025)
par: Maini, Pratyush, et autres
Publié: (2025)
Evaluating whether AI models would sabotage AI safety research
par: Kirk, Robert, et autres
Publié: (2026)
par: Kirk, Robert, et autres
Publié: (2026)
UK AISI Alignment Evaluation Case-Study
par: Souly, Alexandra, et autres
Publié: (2026)
par: Souly, Alexandra, et autres
Publié: (2026)
Mimetic Initialization of MLPs
par: Trockman, Asher, et autres
Publié: (2026)
par: Trockman, Asher, et autres
Publié: (2026)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
par: Akinwande, Victor, et autres
Publié: (2024)
par: Akinwande, Victor, et autres
Publié: (2024)
Does Refusal Training in LLMs Generalize to the Past Tense?
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals
par: Qin, Jeremy, et autres
Publié: (2026)
par: Qin, Jeremy, et autres
Publié: (2026)
Human-Guided Harm Recovery for Computer Use Agents
par: Li, Christy, et autres
Publié: (2026)
par: Li, Christy, et autres
Publié: (2026)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
par: Mazeika, Mantas, et autres
Publié: (2024)
par: Mazeika, Mantas, et autres
Publié: (2024)
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
par: Feng, Yunhao, et autres
Publié: (2026)
par: Feng, Yunhao, et autres
Publié: (2026)
Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
par: Souly, Alexandra, et autres
Publié: (2025)
par: Souly, Alexandra, et autres
Publié: (2025)
HARP: Measuring Harm Amplification in Multi-Agent LLM Systems
par: Rahman, Md Hafizur, et autres
Publié: (2026)
par: Rahman, Md Hafizur, et autres
Publié: (2026)
Towards Low-Resource Harmful Meme Detection with LMM Agents
par: Huang, Jianzhao, et autres
Publié: (2024)
par: Huang, Jianzhao, et autres
Publié: (2024)
FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
par: Williams, Joshua Nathaniel, et autres
Publié: (2024)
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
par: Huang, Benhao, et autres
Publié: (2026)
par: Huang, Benhao, et autres
Publié: (2026)
Why is SAM Robust to Label Noise?
par: Baek, Christina, et autres
Publié: (2024)
par: Baek, Christina, et autres
Publié: (2024)
Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents
par: Talokar, Nivya, et autres
Publié: (2026)
par: Talokar, Nivya, et autres
Publié: (2026)
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
par: Aichberger, Lukas, et autres
Publié: (2025)
par: Aichberger, Lukas, et autres
Publié: (2025)
Training a Generally Curious Agent
par: Tajwar, Fahim, et autres
Publié: (2025)
par: Tajwar, Fahim, et autres
Publié: (2025)
Documents similaires
-
Improving Alignment and Robustness with Circuit Breakers
par: Zou, Andy, et autres
Publié: (2024) -
Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition
par: Zou, Andy, et autres
Publié: (2025) -
OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents
par: Kuntz, Thomas, et autres
Publié: (2025) -
Fundamental Limitations in Pointwise Defences of LLM Finetuning APIs
par: Davies, Xander, et autres
Publié: (2025) -
Evaluating Language Model Reasoning about Confidential Information
par: Sam, Dylan, et autres
Publié: (2025)