Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Huang, Tiansheng, Bhattacharya, Gautam, Joshi, Pratik, Kimball, Josh, Liu, Ling
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!