Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yiqi, Fu, Hongye |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
par: Ding, Renhua, et autres
Publié: (2025)
par: Ding, Renhua, et autres
Publié: (2025)
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
par: Li, Yakai, et autres
Publié: (2025)
par: Li, Yakai, et autres
Publié: (2025)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024)
par: Cheng, Ruoxi, et autres
Publié: (2024)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
par: Li, Jie, et autres
Publié: (2024)
par: Li, Jie, et autres
Publié: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models
par: Feng, Yang, et autres
Publié: (2025)
par: Feng, Yang, et autres
Publié: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
par: Yang, Fan
Publié: (2025)
par: Yang, Fan
Publié: (2025)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
par: Narula, Sidhant, et autres
Publié: (2025)
par: Narula, Sidhant, et autres
Publié: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
par: Gohil, Vasudev
Publié: (2025)
par: Gohil, Vasudev
Publié: (2025)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
par: Park, Junyoung, et autres
Publié: (2026)
par: Park, Junyoung, et autres
Publié: (2026)
SoK: Robustness in Large Language Models against Jailbreak Attacks
par: Xu, Feiyue, et autres
Publié: (2026)
par: Xu, Feiyue, et autres
Publié: (2026)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
par: Das, Badhan Chandra, et autres
Publié: (2026)
par: Das, Badhan Chandra, et autres
Publié: (2026)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
par: Liu, Shuyuan, et autres
Publié: (2025)
par: Liu, Shuyuan, et autres
Publié: (2025)
Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks
par: Geng, Jianing, et autres
Publié: (2025)
par: Geng, Jianing, et autres
Publié: (2025)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
par: Gong, Xueluan, et autres
Publié: (2024)
par: Gong, Xueluan, et autres
Publié: (2024)
Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models
par: Wang, Shuqiang, et autres
Publié: (2026)
par: Wang, Shuqiang, et autres
Publié: (2026)
Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models
par: Luo, Jiayi, et autres
Publié: (2025)
par: Luo, Jiayi, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
par: Teng, Ma, et autres
Publié: (2024)
par: Teng, Ma, et autres
Publié: (2024)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
par: Hong, Wenjing, et autres
Publié: (2026)
par: Hong, Wenjing, et autres
Publié: (2026)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
par: Song, Weiming, et autres
Publié: (2026)
par: Song, Weiming, et autres
Publié: (2026)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2026)
par: Wang, Zhaoqi, et autres
Publié: (2026)
Stealthy Backdoor Attack to Real-world Models in Android Apps
par: Wei, Jiali, et autres
Publié: (2025)
par: Wei, Jiali, et autres
Publié: (2025)
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
par: Zahran, Noureldin, et autres
Publié: (2025)
par: Zahran, Noureldin, et autres
Publié: (2025)
StealthInk: A Multi-bit and Stealthy Watermark for Large Language Models
par: Jiang, Ya, et autres
Publié: (2025)
par: Jiang, Ya, et autres
Publié: (2025)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
par: Xiang, Qiuchi, et autres
Publié: (2026)
par: Xiang, Qiuchi, et autres
Publié: (2026)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
par: Liu, Xiaogeng, et autres
Publié: (2026)
par: Liu, Xiaogeng, et autres
Publié: (2026)
EVA: Editing for Versatile Alignment against Jailbreaks
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Emoji-Based Jailbreaking of Large Language Models
par: Gopinadh, M P V S, et autres
Publié: (2026)
par: Gopinadh, M P V S, et autres
Publié: (2026)
Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction
par: Wang, Hongtao, et autres
Publié: (2026)
par: Wang, Hongtao, et autres
Publié: (2026)
Untargeted Jailbreak Attack
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
Documents similaires
-
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
par: Ding, Renhua, et autres
Publié: (2025) -
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
par: Li, Yakai, et autres
Publié: (2025) -
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
par: Cheng, Ruoxi, et autres
Publié: (2024) -
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
par: Li, Jie, et autres
Publié: (2024) -
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)