Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Guozhi, Lin, Weiwei, Huang, Tiansheng, Mo, Ruichao, Mu, Qi, Shen, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
par: Liu, Guozhi, et autres
Publié: (2026)
par: Liu, Guozhi, et autres
Publié: (2026)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
par: Hu, Zixuan, et autres
Publié: (2025)
par: Hu, Zixuan, et autres
Publié: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
par: Zhang, Yukun, et autres
Publié: (2025)
par: Zhang, Yukun, et autres
Publié: (2025)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
par: Zhang, Xiaoyun, et autres
Publié: (2024)
par: Zhang, Xiaoyun, et autres
Publié: (2024)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
par: Djuhera, Aladin, et autres
Publié: (2025)
par: Djuhera, Aladin, et autres
Publié: (2025)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
par: Yi, Xin, et autres
Publié: (2024)
par: Yi, Xin, et autres
Publié: (2024)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
par: Bachu, Saketh, et autres
Publié: (2024)
par: Bachu, Saketh, et autres
Publié: (2024)
Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
Towards Explainable Harmful Meme Detection through Multimodal Debate between Large Language Models
par: Lin, Hongzhan, et autres
Publié: (2024)
par: Lin, Hongzhan, et autres
Publié: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
par: Zhao, Qinghua, et autres
Publié: (2026)
par: Zhao, Qinghua, et autres
Publié: (2026)
Enhancing Vaccine Safety Surveillance: Extracting Vaccine Mentions from Emergency Department Triage Notes Using Fine-Tuned Large Language Models
par: Khademi, Sedigh, et autres
Publié: (2025)
par: Khademi, Sedigh, et autres
Publié: (2025)
Safety-Aware Fine-Tuning of Large Language Models
par: Choi, Hyeong Kyu, et autres
Publié: (2024)
par: Choi, Hyeong Kyu, et autres
Publié: (2024)
Reinforcement Tuning for Detecting Stances and Debunking Rumors Jointly with Large Language Models
par: Yang, Ruichao, et autres
Publié: (2024)
par: Yang, Ruichao, et autres
Publié: (2024)
The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety
par: Springer, Max, et autres
Publié: (2026)
par: Springer, Max, et autres
Publié: (2026)
CycleNet: Enhancing Time Series Forecasting through Modeling Periodic Patterns
par: Lin, Shengsheng, et autres
Publié: (2024)
par: Lin, Shengsheng, et autres
Publié: (2024)
VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples
par: Sun, Qixin, et autres
Publié: (2025)
par: Sun, Qixin, et autres
Publié: (2025)
Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models
par: Xie, Yingsha, et autres
Publié: (2026)
par: Xie, Yingsha, et autres
Publié: (2026)
Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents
par: Gulati, Idhant, et autres
Publié: (2026)
par: Gulati, Idhant, et autres
Publié: (2026)
Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
par: Wu, Yebo, et autres
Publié: (2025)
par: Wu, Yebo, et autres
Publié: (2025)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Governance-Aware Hybrid Fine-Tuning for Multilingual Large Language Models
par: Qi, Haomin, et autres
Publié: (2025)
par: Qi, Haomin, et autres
Publié: (2025)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
par: Han, Bing, et autres
Publié: (2025)
par: Han, Bing, et autres
Publié: (2025)
Efficient Federated Fine-Tuning of Large Language Models with Layer Dropout
par: Wang, Shilong, et autres
Publié: (2025)
par: Wang, Shilong, et autres
Publié: (2025)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
par: Chen, Shuhao, et autres
Publié: (2026)
par: Chen, Shuhao, et autres
Publié: (2026)
Learning Reward for Robot Skills Using Large Language Models via Self-Alignment
par: Zeng, Yuwei, et autres
Publié: (2024)
par: Zeng, Yuwei, et autres
Publié: (2024)
Split Fine-Tuning for Large Language Models in Wireless Networks
par: Zhang, Songge, et autres
Publié: (2025)
par: Zhang, Songge, et autres
Publié: (2025)
FedQuad: Adaptive Layer-wise LoRA Deployment and Activation Quantization for Federated Fine-Tuning
par: Li, Rukuo, et autres
Publié: (2025)
par: Li, Rukuo, et autres
Publié: (2025)
SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
par: Li, Xiangman, et autres
Publié: (2025)
par: Li, Xiangman, et autres
Publié: (2025)
Documents similaires
-
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
par: Liu, Guozhi, et autres
Publié: (2026) -
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025) -
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024) -
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024) -
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)