Distract Large Language Models for Automatic Jailbreak Attack
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Zeguan, Yang, Yan, Chen, Guanhua, Chen, Yun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters
di: Yang, Yan, et al.
Pubblicazione: (2024)
di: Yang, Yan, et al.
Pubblicazione: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
di: Luo, Weidi, et al.
Pubblicazione: (2024)
di: Luo, Weidi, et al.
Pubblicazione: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
di: Wang, Libo
Pubblicazione: (2024)
di: Wang, Libo
Pubblicazione: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models Through Content Concretization
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025)
di: Yi, Sibo, et al.
Pubblicazione: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
di: Li, Xiao, et al.
Pubblicazione: (2024)
di: Li, Xiao, et al.
Pubblicazione: (2024)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
Defending against Jailbreak through Early Exit Generation of Large Language Models
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
di: Zhou, Andy, et al.
Pubblicazione: (2025)
di: Zhou, Andy, et al.
Pubblicazione: (2025)
Large Reasoning Models Are Autonomous Jailbreak Agents
di: Hagendorff, Thilo, et al.
Pubblicazione: (2025)
di: Hagendorff, Thilo, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters
di: Yang, Yan, et al.
Pubblicazione: (2024) -
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025) -
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024) -
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025) -
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)