Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wei, Zhang, Chen, Hanxuan, Hu, Peilu, Wei, Zhenyuan, Liang, Chenwei, Luo, Jing, Ni, Ziyi, Yan, Hao, Mei, Li, Lang, Shengning, Lu, Kuan, Xiao, Xi, Han, Zhimo, Wang, Yijin, Zhang, Yichao, Yang, Chen, Hao, Junfeng, Gu, Jiayi, Bao, Riyang, Wang, Mu-Jiang-Shan
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866915961709264896
author Wei, Zhang
Chen, Hanxuan
Hu, Peilu
Wei, Zhenyuan
Liang, Chenwei
Luo, Jing
Ni, Ziyi
Yan, Hao
Mei, Li
Lang, Shengning
Lu, Kuan
Xiao, Xi
Han, Zhimo
Wang, Yijin
Zhang, Yichao
Yang, Chen
Hao, Junfeng
Gu, Jiayi
Bao, Riyang
Wang, Mu-Jiang-Shan
author_facet Wei, Zhang
Chen, Hanxuan
Hu, Peilu
Wei, Zhenyuan
Liang, Chenwei
Luo, Jing
Ni, Ziyi
Yan, Hao
Mei, Li
Lang, Shengning
Lu, Kuan
Xiao, Xi
Han, Zhimo
Wang, Yijin
Zhang, Yichao
Yang, Chen
Hao, Junfeng
Gu, Jiayi
Bao, Riyang
Wang, Mu-Jiang-Shan
contents The increasing deployment of large language models (LLMs) in safety-critical applications raises fundamental challenges in systematically evaluating robustness against adversarial behaviors. Existing red-teaming practices are largely manual and expert-driven, which limits scalability, reproducibility, and coverage in high-dimensional prompt spaces. We formulate automated LLM red-teaming as a structured adversarial search problem and propose a learning-driven framework for scalable vulnerability discovery. The approach combines meta-prompt-guided adversarial prompt generation with a hierarchical execution and detection pipeline, enabling standardized evaluation across six representative threat categories, including reward hacking, deceptive alignment, data exfiltration, sandbagging, inappropriate tool use, and chain-of-thought manipulation. Extensive experiments on GPT-OSS-20B identify 47 vulnerabilities, including 21 high-severity failures and 12 previously undocumented attack patterns. Compared with manual red-teaming under matched query budgets, our method achieves a 3.9$\times$ higher discovery rate with 89\% detection accuracy, demonstrating superior coverage, efficiency, and reproducibility for large-scale robustness evaluation.
format Preprint
id arxiv_https___arxiv_org_abs_2512_20677
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
Wei, Zhang
Chen, Hanxuan
Hu, Peilu
Wei, Zhenyuan
Liang, Chenwei
Luo, Jing
Ni, Ziyi
Yan, Hao
Mei, Li
Lang, Shengning
Lu, Kuan
Xiao, Xi
Han, Zhimo
Wang, Yijin
Zhang, Yichao
Yang, Chen
Hao, Junfeng
Gu, Jiayi
Bao, Riyang
Wang, Mu-Jiang-Shan
Cryptography and Security
Computation and Language
The increasing deployment of large language models (LLMs) in safety-critical applications raises fundamental challenges in systematically evaluating robustness against adversarial behaviors. Existing red-teaming practices are largely manual and expert-driven, which limits scalability, reproducibility, and coverage in high-dimensional prompt spaces. We formulate automated LLM red-teaming as a structured adversarial search problem and propose a learning-driven framework for scalable vulnerability discovery. The approach combines meta-prompt-guided adversarial prompt generation with a hierarchical execution and detection pipeline, enabling standardized evaluation across six representative threat categories, including reward hacking, deceptive alignment, data exfiltration, sandbagging, inappropriate tool use, and chain-of-thought manipulation. Extensive experiments on GPT-OSS-20B identify 47 vulnerabilities, including 21 high-severity failures and 12 previously undocumented attack patterns. Compared with manual red-teaming under matched query budgets, our method achieves a 3.9$\times$ higher discovery rate with 89\% detection accuracy, demonstrating superior coverage, efficiency, and reproducibility for large-scale robustness evaluation.
title Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
topic Cryptography and Security
Computation and Language
url https://arxiv.org/abs/2512.20677