DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yu, Jiang, Han, Wei, Zhihua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
par: Zhang, Zhexin, et autres
Publié: (2023)
par: Zhang, Zhexin, et autres
Publié: (2023)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
Defending Against Social Engineering Attacks in the Age of LLMs
par: Ai, Lin, et autres
Publié: (2024)
par: Ai, Lin, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
par: Wang, Zijun, et autres
Publié: (2024)
par: Wang, Zijun, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
par: Atil, Berk, et autres
Publié: (2025)
par: Atil, Berk, et autres
Publié: (2025)
Intention Analysis Makes LLMs A Good Jailbreak Defender
par: Zhang, Yuqi, et autres
Publié: (2024)
par: Zhang, Yuqi, et autres
Publié: (2024)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
par: Gao, Lang, et autres
Publié: (2024)
par: Gao, Lang, et autres
Publié: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
par: Chen, Bocheng, et autres
Publié: (2024)
par: Chen, Bocheng, et autres
Publié: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
par: Feng, Yingchaojie, et autres
Publié: (2024)
par: Feng, Yingchaojie, et autres
Publié: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
par: Jiang, Weisen, et autres
Publié: (2025)
par: Jiang, Weisen, et autres
Publié: (2025)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
par: Wei, Zhipeng, et autres
Publié: (2024)
par: Wei, Zhipeng, et autres
Publié: (2024)
Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
par: Meng, Wenlong, et autres
Publié: (2025)
par: Meng, Wenlong, et autres
Publié: (2025)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
par: Li, Xiaoxia, et autres
Publié: (2024)
par: Li, Xiaoxia, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
par: Lv, Lijia, et autres
Publié: (2024)
par: Lv, Lijia, et autres
Publié: (2024)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
par: An, Li, et autres
Publié: (2025)
par: An, Li, et autres
Publié: (2025)
Defending Against Disinformation Attacks in Open-Domain Question Answering
par: Weller, Orion, et autres
Publié: (2022)
par: Weller, Orion, et autres
Publié: (2022)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
par: Hines, Keegan, et autres
Publié: (2024)
par: Hines, Keegan, et autres
Publié: (2024)
Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
par: Lin, Yuping, et autres
Publié: (2024)
par: Lin, Yuping, et autres
Publié: (2024)
SPML: A DSL for Defending Language Models Against Prompt Attacks
par: Sharma, Reshabh K, et autres
Publié: (2024)
par: Sharma, Reshabh K, et autres
Publié: (2024)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
Merging Improves Self-Critique Against Jailbreak Attacks
par: Gallego, Victor
Publié: (2024)
par: Gallego, Victor
Publié: (2024)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
par: Xu, Zhi, et autres
Publié: (2026)
par: Xu, Zhi, et autres
Publié: (2026)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
par: Zhu, Junda, et autres
Publié: (2025)
par: Zhu, Junda, et autres
Publié: (2025)
Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
par: Wei, Zhihua, et autres
Publié: (2026)
par: Wei, Zhihua, et autres
Publié: (2026)
CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks
par: Mercier, Alexandre Le, et autres
Publié: (2026)
par: Mercier, Alexandre Le, et autres
Publié: (2026)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
Documents similaires
-
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024) -
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024) -
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
par: Zhang, Zhexin, et autres
Publié: (2023) -
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024) -
Defending Against Social Engineering Attacks in the Age of LLMs
par: Ai, Lin, et autres
Publié: (2024)