Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Tiansheng, Bhattacharya, Gautam, Joshi, Pratik, Kimball, Josh, Liu, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
par: Lu, Guoxin, et autres
Publié: (2026)
par: Lu, Guoxin, et autres
Publié: (2026)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
SDD: Self-Degraded Defense against Malicious Fine-tuning
par: Chen, Zixuan, et autres
Publié: (2025)
par: Chen, Zixuan, et autres
Publié: (2025)
Predicting memorization within Large Language Models fine-tuned for classification
par: Dentan, Jérémie, et autres
Publié: (2024)
par: Dentan, Jérémie, et autres
Publié: (2024)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
par: Chen, Yuetian, et autres
Publié: (2026)
par: Chen, Yuetian, et autres
Publié: (2026)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Detecting Adversarial Fine-tuning with Auditing Agents
par: Egler, Sarah, et autres
Publié: (2025)
par: Egler, Sarah, et autres
Publié: (2025)
Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
par: Li, Boheng, et autres
Publié: (2025)
par: Li, Boheng, et autres
Publié: (2025)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
par: Huang, Yuan
Publié: (2025)
par: Huang, Yuan
Publié: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Fine-tuning Large Language Models for DGA and DNS Exfiltration Detection
par: Sayed, Md Abu, et autres
Publié: (2024)
par: Sayed, Md Abu, et autres
Publié: (2024)
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
par: Yang, Kang, et autres
Publié: (2025)
par: Yang, Kang, et autres
Publié: (2025)
The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models
par: Xu, Zhiyuan, et autres
Publié: (2025)
par: Xu, Zhiyuan, et autres
Publié: (2025)
Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code
par: Bappy, Md. Azizul Hakim, et autres
Publié: (2025)
par: Bappy, Md. Azizul Hakim, et autres
Publié: (2025)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
Black-box Membership Inference Attacks against Fine-tuned Diffusion Models
par: Pang, Yan, et autres
Publié: (2023)
par: Pang, Yan, et autres
Publié: (2023)
Differentially Private Parameter-Efficient Fine-tuning for Large ASR Models
par: Liu, Hongbin, et autres
Publié: (2024)
par: Liu, Hongbin, et autres
Publié: (2024)
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
par: Panzade, Prajwal, et autres
Publié: (2024)
par: Panzade, Prajwal, et autres
Publié: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
par: Raghuram, Jayaram, et autres
Publié: (2024)
par: Raghuram, Jayaram, et autres
Publié: (2024)
CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning
par: ElZemity, Adel, et autres
Publié: (2025)
par: ElZemity, Adel, et autres
Publié: (2025)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
par: Hsiung, Lei, et autres
Publié: (2025)
par: Hsiung, Lei, et autres
Publié: (2025)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Token-level Data Selection for Safe LLM Fine-tuning
par: Li, Yanping, et autres
Publié: (2026)
par: Li, Yanping, et autres
Publié: (2026)
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
par: Shi, Haonan, et autres
Publié: (2025)
par: Shi, Haonan, et autres
Publié: (2025)
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
par: Li, Shen, et autres
Publié: (2024)
par: Li, Shen, et autres
Publié: (2024)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
par: Ran, Delong, et autres
Publié: (2025)
par: Ran, Delong, et autres
Publié: (2025)
Practical Secure Inference Algorithm for Fine-tuned Large Language Model Based on Fully Homomorphic Encryption
par: Ruoyan, Zhang, et autres
Publié: (2025)
par: Ruoyan, Zhang, et autres
Publié: (2025)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
par: Du, Hao, et autres
Publié: (2025)
par: Du, Hao, et autres
Publié: (2025)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
par: Song, Weiming, et autres
Publié: (2026)
par: Song, Weiming, et autres
Publié: (2026)
PriFFT: Privacy-preserving Federated Fine-tuning of Large Language Models via Hybrid Secret Sharing
par: You, Zhichao, et autres
Publié: (2025)
par: You, Zhichao, et autres
Publié: (2025)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
par: Shen, Guobin, et autres
Publié: (2024)
par: Shen, Guobin, et autres
Publié: (2024)
Documents similaires
-
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024) -
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025) -
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
par: Lu, Guoxin, et autres
Publié: (2026) -
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
par: Wu, Jialin, et autres
Publié: (2025)