Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hsiung, Lei, Pang, Tianyu, Tang, Yung-Chen, Song, Linyue, Ho, Tsung-Yi, Chen, Pin-Yu, Yang, Yaoqing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
von: Yang, Kang, et al.
Veröffentlicht: (2025)
von: Yang, Kang, et al.
Veröffentlicht: (2025)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2024)
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2024)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
von: Zhang, Yuyou, et al.
Veröffentlicht: (2025)
von: Zhang, Yuyou, et al.
Veröffentlicht: (2025)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
von: Wu, Jialin, et al.
Veröffentlicht: (2025)
von: Wu, Jialin, et al.
Veröffentlicht: (2025)
Black-box Membership Inference Attacks against Fine-tuned Diffusion Models
von: Pang, Yan, et al.
Veröffentlicht: (2023)
von: Pang, Yan, et al.
Veröffentlicht: (2023)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
UniASM: Binary Code Similarity Detection without Fine-tuning
von: Gu, Yeming, et al.
Veröffentlicht: (2022)
von: Gu, Yeming, et al.
Veröffentlicht: (2022)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning
von: ElZemity, Adel, et al.
Veröffentlicht: (2025)
von: ElZemity, Adel, et al.
Veröffentlicht: (2025)
StrTune: Data Dependence-based Code Slicing for Binary Similarity Detection with Fine-tuned Representation
von: He, Kaiyan, et al.
Veröffentlicht: (2024)
von: He, Kaiyan, et al.
Veröffentlicht: (2024)
SDD: Self-Degraded Defense against Malicious Fine-tuning
von: Chen, Zixuan, et al.
Veröffentlicht: (2025)
von: Chen, Zixuan, et al.
Veröffentlicht: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
Token-level Data Selection for Safe LLM Fine-tuning
von: Li, Yanping, et al.
Veröffentlicht: (2026)
von: Li, Yanping, et al.
Veröffentlicht: (2026)
Selective Pre-training for Private Fine-tuning
von: Yu, Da, et al.
Veröffentlicht: (2023)
von: Yu, Da, et al.
Veröffentlicht: (2023)
Detecting Adversarial Fine-tuning with Auditing Agents
von: Egler, Sarah, et al.
Veröffentlicht: (2025)
von: Egler, Sarah, et al.
Veröffentlicht: (2025)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
von: Li, Shen, et al.
Veröffentlicht: (2024)
von: Li, Shen, et al.
Veröffentlicht: (2024)
Model Balancing Helps Low-data Training and Fine-tuning
von: Liu, Zihang, et al.
Veröffentlicht: (2024)
von: Liu, Zihang, et al.
Veröffentlicht: (2024)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
von: Zhang, Jiale, et al.
Veröffentlicht: (2025)
von: Zhang, Jiale, et al.
Veröffentlicht: (2025)
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
von: Panzade, Prajwal, et al.
Veröffentlicht: (2024)
von: Panzade, Prajwal, et al.
Veröffentlicht: (2024)
BinSimDB: Benchmark Dataset Construction for Fine-Grained Binary Code Similarity Analysis
von: Zuo, Fei, et al.
Veröffentlicht: (2024)
von: Zuo, Fei, et al.
Veröffentlicht: (2024)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
von: Tang, Xinyu, et al.
Veröffentlicht: (2024)
von: Tang, Xinyu, et al.
Veröffentlicht: (2024)
Fine-tuning Large Language Models for DGA and DNS Exfiltration Detection
von: Sayed, Md Abu, et al.
Veröffentlicht: (2024)
von: Sayed, Md Abu, et al.
Veröffentlicht: (2024)
Differentially Private Parameter-Efficient Fine-tuning for Large ASR Models
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
DP-SAPF: Saliency-Aware Parameter Fine-tuning of Public Models for Differentially Private Image Synthesis
von: Gong, Chen, et al.
Veröffentlicht: (2026)
von: Gong, Chen, et al.
Veröffentlicht: (2026)
Detecting Instruction Fine-tuning Attacks using Influence Function
von: Li, Jiawei
Veröffentlicht: (2025)
von: Li, Jiawei
Veröffentlicht: (2025)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
von: Xie, Zhixin, et al.
Veröffentlicht: (2025)
von: Xie, Zhixin, et al.
Veröffentlicht: (2025)
Lightweight Safety Guardrails Using Fine-tuned BERT Embeddings
von: Zheng, Aaron, et al.
Veröffentlicht: (2024)
von: Zheng, Aaron, et al.
Veröffentlicht: (2024)
Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment
von: Rad, Melissa Kazemi, et al.
Veröffentlicht: (2025)
von: Rad, Melissa Kazemi, et al.
Veröffentlicht: (2025)
ObfuscaTune: Obfuscated Offsite Fine-tuning and Inference of Proprietary LLMs on Private Datasets
von: Frikha, Ahmed, et al.
Veröffentlicht: (2024)
von: Frikha, Ahmed, et al.
Veröffentlicht: (2024)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
von: Kim, Jaehan, et al.
Veröffentlicht: (2024)
von: Kim, Jaehan, et al.
Veröffentlicht: (2024)
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
von: Shi, Haonan, et al.
Veröffentlicht: (2025)
von: Shi, Haonan, et al.
Veröffentlicht: (2025)
FLAMES: Fine-tuning LLMs to Synthesize Invariants for Smart Contract Security
von: Eshghie, Mojtaba, et al.
Veröffentlicht: (2025)
von: Eshghie, Mojtaba, et al.
Veröffentlicht: (2025)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
von: Leong, Chak Tou, et al.
Veröffentlicht: (2024)
von: Leong, Chak Tou, et al.
Veröffentlicht: (2024)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
von: Huang, Yuan
Veröffentlicht: (2025)
von: Huang, Yuan
Veröffentlicht: (2025)
Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
von: Li, Boheng, et al.
Veröffentlicht: (2025)
von: Li, Boheng, et al.
Veröffentlicht: (2025)
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
Poly-Guard: Massive Multi-Domain Safety Policy-Grounded Guardrail Dataset
von: Kang, Mintong, et al.
Veröffentlicht: (2025)
von: Kang, Mintong, et al.
Veröffentlicht: (2025)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
von: Shen, Han, et al.
Veröffentlicht: (2024)
von: Shen, Han, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
von: Yang, Kang, et al.
Veröffentlicht: (2025) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2024) -
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024) -
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
von: Zhang, Yuyou, et al.
Veröffentlicht: (2025) -
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
von: Wu, Jialin, et al.
Veröffentlicht: (2025)