Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiongxiao, Li, Jiazhao, Li, Yiquan, Qi, Xiangyu, Hu, Junjie, Li, Yixuan, McDaniel, Patrick, Chen, Muhao, Li, Bo, Xiao, Chaowei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023)
par: Wang, Jiongxiao, et autres
Publié: (2023)
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
par: Zhang, Jiale, et autres
Publié: (2025)
par: Zhang, Jiale, et autres
Publié: (2025)
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
par: Liu, Xiaogeng, et autres
Publié: (2025)
par: Liu, Xiaogeng, et autres
Publié: (2025)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
par: Lin, Runqi, et autres
Publié: (2025)
par: Lin, Runqi, et autres
Publié: (2025)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
par: Liu, Xiaogeng, et autres
Publié: (2024)
par: Liu, Xiaogeng, et autres
Publié: (2024)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023)
par: Liu, Qin, et autres
Publié: (2023)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
par: Rong, Xuankun, et autres
Publié: (2025)
par: Rong, Xuankun, et autres
Publié: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
par: Wang, Peiran, et autres
Publié: (2024)
par: Wang, Peiran, et autres
Publié: (2024)
Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
par: Li, Xiangfang, et autres
Publié: (2025)
par: Li, Xiangfang, et autres
Publié: (2025)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
Detecting Instruction Fine-tuning Attacks using Influence Function
par: Li, Jiawei
Publié: (2025)
par: Li, Jiawei
Publié: (2025)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
par: Li, Nanxi, et autres
Publié: (2025)
par: Li, Nanxi, et autres
Publié: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
par: Chen, Kejia, et autres
Publié: (2026)
par: Chen, Kejia, et autres
Publié: (2026)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
par: Zhang, Yuyou, et autres
Publié: (2025)
par: Zhang, Yuyou, et autres
Publié: (2025)
Real is not True: Backdoor Attacks Against Deepfake Detection
par: Sun, Hong, et autres
Publié: (2024)
par: Sun, Hong, et autres
Publié: (2024)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
Watch the Watcher! Backdoor Attacks on Security-Enhancing Diffusion Models
par: Li, Changjiang, et autres
Publié: (2024)
par: Li, Changjiang, et autres
Publié: (2024)
Stealthy Targeted Backdoor Attacks against Image Captioning
par: Fan, Wenshu, et autres
Publié: (2024)
par: Fan, Wenshu, et autres
Publié: (2024)
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
par: Zhao, Zhengyue, et autres
Publié: (2025)
par: Zhao, Zhengyue, et autres
Publié: (2025)
Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models
par: Luo, Weidi, et autres
Publié: (2026)
par: Luo, Weidi, et autres
Publié: (2026)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
par: Nian, Yi, et autres
Publié: (2025)
par: Nian, Yi, et autres
Publié: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats
par: Sun, Ruoxi, et autres
Publié: (2024)
par: Sun, Ruoxi, et autres
Publié: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
par: Jin, Haotian, et autres
Publié: (2025)
par: Jin, Haotian, et autres
Publié: (2025)
A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems
par: Wu, Fangzhou, et autres
Publié: (2024)
par: Wu, Fangzhou, et autres
Publié: (2024)
MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
par: Zeng, Yizhe, et autres
Publié: (2026)
par: Zeng, Yizhe, et autres
Publié: (2026)
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
par: Kang, Mintong, et autres
Publié: (2025)
par: Kang, Mintong, et autres
Publié: (2025)
Fusing Pruned and Backdoored Models: Optimal Transport-based Data-free Backdoor Mitigation
par: Lin, Weilin, et autres
Publié: (2024)
par: Lin, Weilin, et autres
Publié: (2024)
Documents similaires
-
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023) -
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024) -
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
par: Zhang, Jiale, et autres
Publié: (2025) -
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
par: Liu, Xiaogeng, et autres
Publié: (2025) -
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)