Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Tiansheng, Hu, Sihao, Liu, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
par: Liu, Guozhi, et autres
Publié: (2024)
par: Liu, Guozhi, et autres
Publié: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
par: Tekin, Selim Furkan, et autres
Publié: (2024)
par: Tekin, Selim Furkan, et autres
Publié: (2024)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
Fine-tuning Large Language Models for Domain-specific Machine Translation
par: Zheng, Jiawei, et autres
Publié: (2024)
par: Zheng, Jiawei, et autres
Publié: (2024)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
par: Tekin, Selim Furkan, et autres
Publié: (2024)
par: Tekin, Selim Furkan, et autres
Publié: (2024)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
par: Hu, Yujia, et autres
Publié: (2024)
par: Hu, Yujia, et autres
Publié: (2024)
On the Loss of Context-awareness in General Instruction Fine-tuning
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Adversarial Evasion Attack Efficiency against Large Language Models
par: Vitorino, João, et autres
Publié: (2024)
par: Vitorino, João, et autres
Publié: (2024)
MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations
par: Wang, Zixiao, et autres
Publié: (2024)
par: Wang, Zixiao, et autres
Publié: (2024)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
par: Lin, Haowei, et autres
Publié: (2024)
par: Lin, Haowei, et autres
Publié: (2024)
Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
par: Ghosh, Bishwamittra, et autres
Publié: (2026)
par: Ghosh, Bishwamittra, et autres
Publié: (2026)
EpilepsyLLM: Domain-Specific Large Language Model Fine-tuned with Epilepsy Medical Knowledge
par: Zhao, Xuyang, et autres
Publié: (2024)
par: Zhao, Xuyang, et autres
Publié: (2024)
Exploring Memorization in Fine-tuned Language Models
par: Zeng, Shenglai, et autres
Publié: (2023)
par: Zeng, Shenglai, et autres
Publié: (2023)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
par: Tang, Xinyu, et autres
Publié: (2024)
par: Tang, Xinyu, et autres
Publié: (2024)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023)
par: Song, Weixi, et autres
Publié: (2023)
Efficient Ensemble for Fine-tuning Language Models on Multiple Datasets
par: Li, Dongyue, et autres
Publié: (2025)
par: Li, Dongyue, et autres
Publié: (2025)
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
par: Wu, Muling, et autres
Publié: (2024)
par: Wu, Muling, et autres
Publié: (2024)
LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models
par: Chen, Yukang, et autres
Publié: (2023)
par: Chen, Yukang, et autres
Publié: (2023)
Do as I do (Safely): Mitigating Task-Specific Fine-tuning Risks in Large Language Models
par: Eiras, Francisco, et autres
Publié: (2024)
par: Eiras, Francisco, et autres
Publié: (2024)
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
par: Tian, Kaiyuan, et autres
Publié: (2026)
par: Tian, Kaiyuan, et autres
Publié: (2026)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
par: Dong, Guanting, et autres
Publié: (2023)
par: Dong, Guanting, et autres
Publié: (2023)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
par: Yin, Haoteng, et autres
Publié: (2024)
par: Yin, Haoteng, et autres
Publié: (2024)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
par: Chen, Pin-Yu, et autres
Publié: (2025)
par: Chen, Pin-Yu, et autres
Publié: (2025)
DaMoC: Efficiently Selecting the Optimal Large Language Model for Fine-tuning Domain Tasks Based on Data and Model Compression
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Automatic Pruning of Fine-tuning Datasets for Transformer-based Language Models
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
par: Tayaranian, Mohammadreza, et autres
Publié: (2024)
Efficient End-to-end Language Model Fine-tuning on Graphs
par: Xue, Rui, et autres
Publié: (2023)
par: Xue, Rui, et autres
Publié: (2023)
Differentially Private Steering for Large Language Model Alignment
par: Goel, Anmol, et autres
Publié: (2025)
par: Goel, Anmol, et autres
Publié: (2025)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
par: Lou, Qian, et autres
Publié: (2024)
par: Lou, Qian, et autres
Publié: (2024)
Complexity-aware fine-tuning
par: Goncharov, Andrey, et autres
Publié: (2025)
par: Goncharov, Andrey, et autres
Publié: (2025)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
par: Zhou, Huichi, et autres
Publié: (2025)
par: Zhou, Huichi, et autres
Publié: (2025)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Documents similaires
-
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025) -
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024) -
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024) -
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
par: Liu, Guozhi, et autres
Publié: (2024)