Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
Fuente:
arXiv
Salvato in:
| Autori principali: | Mehrotra, Anay, Zampetakis, Manolis, Kassianik, Paul, Nelson, Blaine, Anderson, Hyrum, Singer, Yaron, Karbasi, Amin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
di: Gohil, Vasudev
Pubblicazione: (2025)
di: Gohil, Vasudev
Pubblicazione: (2025)
Extracting Memorized Training Data via Decomposition
di: Su, Ellen, et al.
Pubblicazione: (2024)
di: Su, Ellen, et al.
Pubblicazione: (2024)
Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
di: Kassianik, Paul, et al.
Pubblicazione: (2025)
di: Kassianik, Paul, et al.
Pubblicazione: (2025)
Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
di: Weerawardhena, Sajana, et al.
Pubblicazione: (2025)
di: Weerawardhena, Sajana, et al.
Pubblicazione: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
di: Wang, Libo
Pubblicazione: (2024)
di: Wang, Libo
Pubblicazione: (2024)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
di: Yoon, Sung-Hoon, et al.
Pubblicazione: (2026)
di: Yoon, Sung-Hoon, et al.
Pubblicazione: (2026)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
Injecting Undetectable Backdoors in Obfuscated Neural Networks and Language Models
di: Kalavasis, Alkis, et al.
Pubblicazione: (2024)
di: Kalavasis, Alkis, et al.
Pubblicazione: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks
di: Kirch, Nathalie, et al.
Pubblicazione: (2024)
di: Kirch, Nathalie, et al.
Pubblicazione: (2024)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
di: Saglam, Baturay, et al.
Pubblicazione: (2025)
di: Saglam, Baturay, et al.
Pubblicazione: (2025)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
di: Lv, Lijia, et al.
Pubblicazione: (2024)
di: Lv, Lijia, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
di: Panfilov, Alexander, et al.
Pubblicazione: (2025)
di: Panfilov, Alexander, et al.
Pubblicazione: (2025)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
di: Yang, Zhuoran, et al.
Pubblicazione: (2026)
Black-Box Guardrail Reverse-engineering Attack
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
di: Sitawarin, Chawin, et al.
Pubblicazione: (2024)
di: Sitawarin, Chawin, et al.
Pubblicazione: (2024)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
di: Mu, Junjie, et al.
Pubblicazione: (2025)
di: Mu, Junjie, et al.
Pubblicazione: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Adversarial Reasoning at Jailbreaking Time
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2025)
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2025)
A Framework for Rapidly Developing and Deploying Protection Against Large Language Model Attacks
di: Swanda, Adam, et al.
Pubblicazione: (2025)
di: Swanda, Adam, et al.
Pubblicazione: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025) -
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
di: Gohil, Vasudev
Pubblicazione: (2025) -
Extracting Memorized Training Data via Decomposition
di: Su, Ellen, et al.
Pubblicazione: (2024) -
Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
di: Kassianik, Paul, et al.
Pubblicazione: (2025) -
Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
di: Weerawardhena, Sajana, et al.
Pubblicazione: (2025)