Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Wei, Li, Zhe, Li, Yige, Zhang, Ye, Sun, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023)
par: Robey, Alexander, et autres
Publié: (2023)
Do Influence Functions Work on Large Language Models?
par: Li, Zhe, et autres
Publié: (2024)
par: Li, Zhe, et autres
Publié: (2024)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
par: Wong, Ryan, et autres
Publié: (2025)
par: Wong, Ryan, et autres
Publié: (2025)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
par: Zhao, Yunhan, et autres
Publié: (2024)
par: Zhao, Yunhan, et autres
Publié: (2024)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models
par: Wit, Maria Carolina Cornelia, et autres
Publié: (2025)
par: Wit, Maria Carolina Cornelia, et autres
Publié: (2025)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
par: Yi, Jingwei, et autres
Publié: (2023)
par: Yi, Jingwei, et autres
Publié: (2023)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
par: Li, Zhe, et autres
Publié: (2025)
par: Li, Zhe, et autres
Publié: (2025)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026)
par: Cui, Kaiyuan, et autres
Publié: (2026)
Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models
par: Li, Yige, et autres
Publié: (2024)
par: Li, Yige, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
par: Zhao, Chongwen, et autres
Publié: (2024)
par: Zhao, Chongwen, et autres
Publié: (2024)
SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
par: Wei, Zhihua, et autres
Publié: (2026)
par: Wei, Zhihua, et autres
Publié: (2026)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
par: Chen, Guangke, et autres
Publié: (2025)
par: Chen, Guangke, et autres
Publié: (2025)
CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization
par: Min, Nay Myat, et autres
Publié: (2024)
par: Min, Nay Myat, et autres
Publié: (2024)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
par: Li, Jie, et autres
Publié: (2024)
par: Li, Jie, et autres
Publié: (2024)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2026)
par: Wang, Zhaoqi, et autres
Publié: (2026)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
par: Jin, Haotian, et autres
Publié: (2025)
par: Jin, Haotian, et autres
Publié: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
par: Ma, Jiachen, et autres
Publié: (2024)
par: Ma, Jiachen, et autres
Publié: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Defending Against Beta Poisoning Attacks in Machine Learning Models
par: Gulciftci, Nilufer, et autres
Publié: (2025)
par: Gulciftci, Nilufer, et autres
Publié: (2025)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Documents similaires
-
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024) -
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026) -
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023) -
Do Influence Functions Work on Large Language Models?
par: Li, Zhe, et autres
Publié: (2024) -
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025)