DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yi, Weng, Fenghua, Yang, Sibei, Qin, Zhan, Huang, Minlie, Wang, Wenjie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EVA: Editing for Versatile Alignment against Jailbreaks
von: Wang, Yi, et al.
Veröffentlicht: (2026)
von: Wang, Yi, et al.
Veröffentlicht: (2026)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
von: Yang, Xianglin, et al.
Veröffentlicht: (2025)
von: Yang, Xianglin, et al.
Veröffentlicht: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
von: Weng, Fenghua, et al.
Veröffentlicht: (2025)
von: Weng, Fenghua, et al.
Veröffentlicht: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
von: Ran, Delong, et al.
Veröffentlicht: (2024)
von: Ran, Delong, et al.
Veröffentlicht: (2024)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
von: Wong, Ryan, et al.
Veröffentlicht: (2025)
von: Wong, Ryan, et al.
Veröffentlicht: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
von: Li, Jie, et al.
Veröffentlicht: (2024)
von: Li, Jie, et al.
Veröffentlicht: (2024)
User Behavior Analysis in Privacy Protection with Large Language Models: A Study on Privacy Preferences with Limited Data
von: Yang, Haowei, et al.
Veröffentlicht: (2025)
von: Yang, Haowei, et al.
Veröffentlicht: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoqun, et al.
Veröffentlicht: (2024)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
von: Nian, Yi, et al.
Veröffentlicht: (2025)
von: Nian, Yi, et al.
Veröffentlicht: (2025)
Membership Inference Attacks Against Vision-Language Models
von: Hu, Yuke, et al.
Veröffentlicht: (2025)
von: Hu, Yuke, et al.
Veröffentlicht: (2025)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
von: Wu, Zihui, et al.
Veröffentlicht: (2024)
von: Wu, Zihui, et al.
Veröffentlicht: (2024)
Emoji-Based Jailbreaking of Large Language Models
von: Gopinadh, M P V S, et al.
Veröffentlicht: (2026)
von: Gopinadh, M P V S, et al.
Veröffentlicht: (2026)
Untargeted Jailbreak Attack
von: Huang, Xinzhe, et al.
Veröffentlicht: (2025)
von: Huang, Xinzhe, et al.
Veröffentlicht: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
von: Liu, Aofan, et al.
Veröffentlicht: (2025)
von: Liu, Aofan, et al.
Veröffentlicht: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
von: Yang, Fan
Veröffentlicht: (2025)
von: Yang, Fan
Veröffentlicht: (2025)
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
von: Li, Yakai, et al.
Veröffentlicht: (2025)
von: Li, Yakai, et al.
Veröffentlicht: (2025)
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
von: Pu, Rui, et al.
Veröffentlicht: (2025)
von: Pu, Rui, et al.
Veröffentlicht: (2025)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
von: Wu, Jinman, et al.
Veröffentlicht: (2026)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
von: Zhang, Deyue, et al.
Veröffentlicht: (2025)
von: Zhang, Deyue, et al.
Veröffentlicht: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
von: Xu, Feiyue, et al.
Veröffentlicht: (2026)
von: Xu, Feiyue, et al.
Veröffentlicht: (2026)
Recent Advances in Attack and Defense Approaches of Large Language Models
von: Cui, Jing, et al.
Veröffentlicht: (2024)
von: Cui, Jing, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
von: Zheng, Youjia, et al.
Veröffentlicht: (2025)
von: Zheng, Youjia, et al.
Veröffentlicht: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
von: Wang, Youze, et al.
Veröffentlicht: (2025)
von: Wang, Youze, et al.
Veröffentlicht: (2025)
ShallowJail: Steering Jailbreaks against Large Language Models
von: Liu, Shang, et al.
Veröffentlicht: (2026)
von: Liu, Shang, et al.
Veröffentlicht: (2026)
Imperceptible Jailbreaking against Large Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
von: Wang, Xi, et al.
Veröffentlicht: (2026)
von: Wang, Xi, et al.
Veröffentlicht: (2026)
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
von: Wang, Zhilong, et al.
Veröffentlicht: (2024)
von: Wang, Zhilong, et al.
Veröffentlicht: (2024)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
von: Hong, Wenjing, et al.
Veröffentlicht: (2026)
von: Hong, Wenjing, et al.
Veröffentlicht: (2026)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
von: Yang, Yiqi, et al.
Veröffentlicht: (2024)
von: Yang, Yiqi, et al.
Veröffentlicht: (2024)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
von: Xiong, Chen, et al.
Veröffentlicht: (2026)
von: Xiong, Chen, et al.
Veröffentlicht: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
EVA: Editing for Versatile Alignment against Jailbreaks
von: Wang, Yi, et al.
Veröffentlicht: (2026) -
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024) -
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
von: Yang, Xianglin, et al.
Veröffentlicht: (2025) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024) -
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)