TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoon, Sung-Hoon, Qian, Ruizhi, Zhao, Minda, Li, Weiyue, Wang, Mengyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
par: Gohil, Vasudev
Publié: (2025)
par: Gohil, Vasudev
Publié: (2025)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)
par: Chen, Guorui, et autres
Publié: (2025)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
par: Zhang, Tianyu, et autres
Publié: (2024)
par: Zhang, Tianyu, et autres
Publié: (2024)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
par: Wu, Tianyi, et autres
Publié: (2025)
par: Wu, Tianyi, et autres
Publié: (2025)
Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents
par: Das, Saswat, et autres
Publié: (2025)
par: Das, Saswat, et autres
Publié: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025)
par: Wang, Zhaoqi, et autres
Publié: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning
par: Domico, Kyle, et autres
Publié: (2025)
par: Domico, Kyle, et autres
Publié: (2025)
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
par: Li, Yakai, et autres
Publié: (2025)
par: Li, Yakai, et autres
Publié: (2025)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
par: Li, Xirui, et autres
Publié: (2024)
par: Li, Xirui, et autres
Publié: (2024)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
par: Sitawarin, Chawin, et autres
Publié: (2024)
par: Sitawarin, Chawin, et autres
Publié: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
PathSeeker: Exploring LLM Security Vulnerabilities with a Reinforcement Learning-Based Jailbreak Approach
par: Lin, Zhihao, et autres
Publié: (2024)
par: Lin, Zhihao, et autres
Publié: (2024)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
par: Yang, Yiqi, et autres
Publié: (2024)
par: Yang, Yiqi, et autres
Publié: (2024)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
par: Huang, Chung-ju, et autres
Publié: (2026)
par: Huang, Chung-ju, et autres
Publié: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks
par: Kabir, Md Rysul, et autres
Publié: (2026)
par: Kabir, Md Rysul, et autres
Publié: (2026)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
par: Zhao, Chongwen, et autres
Publié: (2024)
par: Zhao, Chongwen, et autres
Publié: (2024)
Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility
par: Murphy, Brendan, et autres
Publié: (2025)
par: Murphy, Brendan, et autres
Publié: (2025)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
par: Ding, Junchen, et autres
Publié: (2025)
par: Ding, Junchen, et autres
Publié: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2024)
par: Wang, Xinyuan, et autres
Publié: (2024)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search
par: Moss, Robert J.
Publié: (2024)
par: Moss, Robert J.
Publié: (2024)
Documents similaires
-
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025) -
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
par: Gohil, Vasudev
Publié: (2025) -
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023) -
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024) -
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024)