Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Tiansheng, Hu, Sihao, Ilhan, Fatih, Tekin, Selim Furkan, Liu, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
par: Tekin, Selim Furkan, et autres
Publié: (2024)
par: Tekin, Selim Furkan, et autres
Publié: (2024)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
par: Tekin, Selim Furkan, et autres
Publié: (2024)
par: Tekin, Selim Furkan, et autres
Publié: (2024)
Robust Few-Shot Ensemble Learning with Focal Diversity-Based Pruning
par: Tekin, Selim Furkan, et autres
Publié: (2024)
par: Tekin, Selim Furkan, et autres
Publié: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
par: Ilhan, Fatih, et autres
Publié: (2026)
par: Ilhan, Fatih, et autres
Publié: (2026)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
par: Liu, Guozhi, et autres
Publié: (2024)
par: Liu, Guozhi, et autres
Publié: (2024)
MELT: A Behavioral Trace Dataset for High-Risk Memecoin Launch Detection
par: Hu, Sihao, et autres
Publié: (2026)
par: Hu, Sihao, et autres
Publié: (2026)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
A Survey on Large Language Model-Based Game Agents
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Adversarial Attention Perturbations for Large Object Detection Transformers
par: Yahn, Zachary, et autres
Publié: (2025)
par: Yahn, Zachary, et autres
Publié: (2025)
FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
par: Ilhan, Fatih, et autres
Publié: (2025)
par: Ilhan, Fatih, et autres
Publié: (2025)
Personalized Face Privacy Protection From a Single Image
par: Yahn, Zachary, et autres
Publié: (2026)
par: Yahn, Zachary, et autres
Publié: (2026)
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
par: Xu, Yichang, et autres
Publié: (2026)
par: Xu, Yichang, et autres
Publié: (2026)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
par: Hu, Sihao, et autres
Publié: (2024)
par: Hu, Sihao, et autres
Publié: (2024)
Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents
par: Tekin, Selim Furkan, et autres
Publié: (2025)
par: Tekin, Selim Furkan, et autres
Publié: (2025)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
par: Fu, Wenjie, et autres
Publié: (2023)
par: Fu, Wenjie, et autres
Publié: (2023)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
par: Hu, Zixuan, et autres
Publié: (2025)
par: Hu, Zixuan, et autres
Publié: (2025)
SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
par: Li, Xiangman, et autres
Publié: (2025)
par: Li, Xiangman, et autres
Publié: (2025)
A Neurosymbolic Agent System for Compositional Visual Reasoning
par: Xu, Yichang, et autres
Publié: (2025)
par: Xu, Yichang, et autres
Publié: (2025)
Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
par: Ding, Sihao
Publié: (2026)
par: Ding, Sihao
Publié: (2026)
Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks
par: Youstra, Jack, et autres
Publié: (2025)
par: Youstra, Jack, et autres
Publié: (2025)
TeZO: Empowering the Low-Rankness on the Temporal Dimension in the Zeroth-Order Optimization for Fine-tuning LLMs
par: Sun, Yan, et autres
Publié: (2025)
par: Sun, Yan, et autres
Publié: (2025)
Lazy Data Practices Harm Fairness Research
par: Simson, Jan, et autres
Publié: (2024)
par: Simson, Jan, et autres
Publié: (2024)
Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
par: Hsu, Chia-Yi, et autres
Publié: (2024)
par: Hsu, Chia-Yi, et autres
Publié: (2024)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
par: Tekin, Selim Furkan, et autres
Publié: (2026)
par: Tekin, Selim Furkan, et autres
Publié: (2026)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
par: Huang, Yuan
Publié: (2025)
par: Huang, Yuan
Publié: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
par: Chen, Pin-Yu, et autres
Publié: (2025)
par: Chen, Pin-Yu, et autres
Publié: (2025)
Helpful or Harmful Data? Fine-tuning-free Shapley Attribution for Explaining Language Model Predictions
par: Wang, Jingtan, et autres
Publié: (2024)
par: Wang, Jingtan, et autres
Publié: (2024)
Membership Inference Attacks Against Fine-tuned Diffusion Language Models
par: Chen, Yuetian, et autres
Publié: (2026)
par: Chen, Yuetian, et autres
Publié: (2026)
Fine-tuning Large Language Model for Automated Algorithm Design
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
par: Li, Yuxi, et autres
Publié: (2024)
par: Li, Yuxi, et autres
Publié: (2024)
A Study of Optimizations for Fine-tuning Large Language Models
par: Singh, Arjun, et autres
Publié: (2024)
par: Singh, Arjun, et autres
Publié: (2024)
Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
par: Nguyen, Quoc Minh, et autres
Publié: (2026)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Towards Green AI in Fine-tuning Large Language Models via Adaptive Backpropagation
par: Huang, Kai, et autres
Publié: (2023)
par: Huang, Kai, et autres
Publié: (2023)
Documents similaires
-
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
par: Huang, Tiansheng, et autres
Publié: (2024) -
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025) -
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
par: Huang, Tiansheng, et autres
Publié: (2024) -
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
par: Huang, Tiansheng, et autres
Publié: (2024) -
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
par: Huang, Tiansheng, et autres
Publié: (2025)