Enhancing Jailbreak Attacks with Diversity Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xu, Jing, Dinghao, Wan, Xiaojun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
di: Wang, Zijun, et al.
Pubblicazione: (2024)
di: Wang, Zijun, et al.
Pubblicazione: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
di: Xu, Zhi, et al.
Pubblicazione: (2026)
di: Xu, Zhi, et al.
Pubblicazione: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
di: Wei, Zhipeng, et al.
Pubblicazione: (2024)
di: Wei, Zhipeng, et al.
Pubblicazione: (2024)
$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks
di: Huang, Baizhou, et al.
Pubblicazione: (2024)
di: Huang, Baizhou, et al.
Pubblicazione: (2024)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
di: Zhang, Xu, et al.
Pubblicazione: (2024)
di: Zhang, Xu, et al.
Pubblicazione: (2024)
BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
Jailbreaking Large Language Models with Morality Attacks
di: Su, Ying, et al.
Pubblicazione: (2026)
di: Su, Ying, et al.
Pubblicazione: (2026)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Diversity Helps Jailbreak Large Language Models
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
di: Lin, Yuping, et al.
Pubblicazione: (2024)
di: Lin, Yuping, et al.
Pubblicazione: (2024)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
di: Mu, Junjie, et al.
Pubblicazione: (2025)
di: Mu, Junjie, et al.
Pubblicazione: (2025)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
di: Cao, Hongye, et al.
Pubblicazione: (2025)
di: Cao, Hongye, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks
di: Liu, Sheng, et al.
Pubblicazione: (2025)
di: Liu, Sheng, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Boosting Jailbreak Attack with Momentum
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
di: Li, Qizhang, et al.
Pubblicazione: (2024)
di: Li, Qizhang, et al.
Pubblicazione: (2024)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
di: Guo, Xingang, et al.
Pubblicazione: (2024)
di: Guo, Xingang, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
di: Zhou, Yao, et al.
Pubblicazione: (2026)
di: Zhou, Yao, et al.
Pubblicazione: (2026)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025) -
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024) -
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
di: Tang, Yihong, et al.
Pubblicazione: (2024) -
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
di: Wang, Zijun, et al.
Pubblicazione: (2024) -
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
di: Xu, Zhi, et al.
Pubblicazione: (2026)