Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Guozhi, Mu, Qi, Huang, Tiansheng, Wang, Xinhua, Shen, Li, Lin, Weiwei, Li, Zhang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
di: Liu, Guozhi, et al.
Pubblicazione: (2024)
di: Liu, Guozhi, et al.
Pubblicazione: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
di: Kim, Jaehan, et al.
Pubblicazione: (2025)
Robustifying Safety-Aligned Large Language Models through Clean Data Curation
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
PriFFT: Privacy-preserving Federated Fine-tuning of Large Language Models via Hybrid Secret Sharing
di: You, Zhichao, et al.
Pubblicazione: (2025)
di: You, Zhichao, et al.
Pubblicazione: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
di: Liu, Yuexiao, et al.
Pubblicazione: (2025)
di: Liu, Yuexiao, et al.
Pubblicazione: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
External Data Extraction Attacks against Retrieval-Augmented Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
di: Huang, Yuan
Pubblicazione: (2025)
di: Huang, Yuan
Pubblicazione: (2025)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
Fine-tuning Large Language Models for DGA and DNS Exfiltration Detection
di: Sayed, Md Abu, et al.
Pubblicazione: (2024)
di: Sayed, Md Abu, et al.
Pubblicazione: (2024)
Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data
di: Akkus, Atilla, et al.
Pubblicazione: (2024)
di: Akkus, Atilla, et al.
Pubblicazione: (2024)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
di: Liu, Guozhi, et al.
Pubblicazione: (2026)
di: Liu, Guozhi, et al.
Pubblicazione: (2026)
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
Black-box Membership Inference Attacks against Fine-tuned Diffusion Models
di: Pang, Yan, et al.
Pubblicazione: (2023)
di: Pang, Yan, et al.
Pubblicazione: (2023)
Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
di: Li, Boheng, et al.
Pubblicazione: (2025)
di: Li, Boheng, et al.
Pubblicazione: (2025)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
Differentially Private Parameter-Efficient Fine-tuning for Large ASR Models
di: Liu, Hongbin, et al.
Pubblicazione: (2024)
di: Liu, Hongbin, et al.
Pubblicazione: (2024)
SDD: Self-Degraded Defense against Malicious Fine-tuning
di: Chen, Zixuan, et al.
Pubblicazione: (2025)
di: Chen, Zixuan, et al.
Pubblicazione: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Token-level Data Selection for Safe LLM Fine-tuning
di: Li, Yanping, et al.
Pubblicazione: (2026)
di: Li, Yanping, et al.
Pubblicazione: (2026)
Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
di: Akiri, Charankumar, et al.
Pubblicazione: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
di: Zhang, Yuyou, et al.
Pubblicazione: (2025)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
Practical Secure Inference Algorithm for Fine-tuned Large Language Model Based on Fully Homomorphic Encryption
di: Ruoyan, Zhang, et al.
Pubblicazione: (2025)
di: Ruoyan, Zhang, et al.
Pubblicazione: (2025)
DP-SAPF: Saliency-Aware Parameter Fine-tuning of Public Models for Differentially Private Image Synthesis
di: Gong, Chen, et al.
Pubblicazione: (2026)
di: Gong, Chen, et al.
Pubblicazione: (2026)
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
di: Shi, Haonan, et al.
Pubblicazione: (2025)
di: Shi, Haonan, et al.
Pubblicazione: (2025)
Safety Layers in Aligned Large Language Models: The Key to LLM Security
di: Li, Shen, et al.
Pubblicazione: (2024)
di: Li, Shen, et al.
Pubblicazione: (2024)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
di: Huang, Tiansheng, et al.
Pubblicazione: (2024) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024) -
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025) -
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
di: Liu, Guozhi, et al.
Pubblicazione: (2024) -
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)