Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Zihan, Hu, Mengxuan, Zhu, Ronghang, Li, Sheng, Vullikanti, Anil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
di: Guan, Zihan, et al.
Pubblicazione: (2024)
di: Guan, Zihan, et al.
Pubblicazione: (2024)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
di: Guan, Zihan, et al.
Pubblicazione: (2026)
di: Guan, Zihan, et al.
Pubblicazione: (2026)
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
di: Li, Pengxiang, et al.
Pubblicazione: (2024)
Large Language Models Lack Temporal Awareness of Medical Knowledge
di: Guan, Zihan, et al.
Pubblicazione: (2026)
di: Guan, Zihan, et al.
Pubblicazione: (2026)
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
di: He, Luxi, et al.
Pubblicazione: (2024)
di: He, Luxi, et al.
Pubblicazione: (2024)
What Makes and Breaks Safety Fine-tuning? A Mechanistic Study
di: Jain, Samyak, et al.
Pubblicazione: (2024)
di: Jain, Samyak, et al.
Pubblicazione: (2024)
Improving Sampling Methods for Fine-tuning SentenceBERT in Text Streams
di: Garcia, Cristiano Mesquita, et al.
Pubblicazione: (2024)
di: Garcia, Cristiano Mesquita, et al.
Pubblicazione: (2024)
No Free Lunch: Retrieval-Augmented Generation Undermines Fairness in LLMs, Even for Vigilant Users
di: Hu, Mengxuan, et al.
Pubblicazione: (2024)
di: Hu, Mengxuan, et al.
Pubblicazione: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
di: Zhou, Huichi, et al.
Pubblicazione: (2025)
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
di: Tian, Kaiyuan, et al.
Pubblicazione: (2026)
di: Tian, Kaiyuan, et al.
Pubblicazione: (2026)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
Layer-wise Importance Matters: Less Memory for Better Performance in Parameter-efficient Fine-tuning of Large Language Models
di: Yao, Kai, et al.
Pubblicazione: (2024)
di: Yao, Kai, et al.
Pubblicazione: (2024)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
di: Wang, Guoli, et al.
Pubblicazione: (2026)
di: Wang, Guoli, et al.
Pubblicazione: (2026)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
di: Jan, Essa, et al.
Pubblicazione: (2024)
di: Jan, Essa, et al.
Pubblicazione: (2024)
Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models
di: Goel, Anmol, et al.
Pubblicazione: (2026)
di: Goel, Anmol, et al.
Pubblicazione: (2026)
Advancing Parameter Efficiency in Fine-tuning via Representation Editing
di: Wu, Muling, et al.
Pubblicazione: (2024)
di: Wu, Muling, et al.
Pubblicazione: (2024)
Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
di: Vennemeyer, Daniel, et al.
Pubblicazione: (2026)
PMSS: Pretrained Matrices Skeleton Selection for LLM Fine-tuning
di: Wang, Qibin, et al.
Pubblicazione: (2024)
di: Wang, Qibin, et al.
Pubblicazione: (2024)
SEE: Continual Fine-tuning with Sequential Ensemble of Experts
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs
di: Liu, Zhihao, et al.
Pubblicazione: (2024)
di: Liu, Zhihao, et al.
Pubblicazione: (2024)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
Efficient Ensemble for Fine-tuning Language Models on Multiple Datasets
di: Li, Dongyue, et al.
Pubblicazione: (2025)
di: Li, Dongyue, et al.
Pubblicazione: (2025)
LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
di: Perin, Gabriel J., et al.
Pubblicazione: (2025)
di: Perin, Gabriel J., et al.
Pubblicazione: (2025)
A Classical View on Benign Overfitting: The Role of Sample Size
di: Park, Junhyung, et al.
Pubblicazione: (2025)
di: Park, Junhyung, et al.
Pubblicazione: (2025)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
di: Shen, Han, et al.
Pubblicazione: (2024)
di: Shen, Han, et al.
Pubblicazione: (2024)
REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy
di: Chang, Haw-Shiuan, et al.
Pubblicazione: (2024)
di: Chang, Haw-Shiuan, et al.
Pubblicazione: (2024)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
CoMoE: Contrastive Representation for Mixture-of-Experts in Parameter-Efficient Fine-tuning
di: Feng, Jinyuan, et al.
Pubblicazione: (2025)
di: Feng, Jinyuan, et al.
Pubblicazione: (2025)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
di: Schneider, Johannes
Pubblicazione: (2024)
di: Schneider, Johannes
Pubblicazione: (2024)
On the Loss of Context-awareness in General Instruction Fine-tuning
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
Learn Hard Problems During RL with Reference Guided Fine-tuning
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within Packs
di: Dong, Jiancheng, et al.
Pubblicazione: (2024)
di: Dong, Jiancheng, et al.
Pubblicazione: (2024)
Two-stage LLM Fine-tuning with Less Specialization and More Generalization
di: Wang, Yihan, et al.
Pubblicazione: (2022)
di: Wang, Yihan, et al.
Pubblicazione: (2022)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
Dissecting Outlier Dynamics in LLM NVFP4 Pretraining
di: Dong, Peijie, et al.
Pubblicazione: (2026)
di: Dong, Peijie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
di: Guan, Zihan, et al.
Pubblicazione: (2024) -
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
di: Guan, Zihan, et al.
Pubblicazione: (2026) -
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
di: Li, Pengxiang, et al.
Pubblicazione: (2024) -
Large Language Models Lack Temporal Awareness of Medical Knowledge
di: Guan, Zihan, et al.
Pubblicazione: (2026) -
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
di: He, Luxi, et al.
Pubblicazione: (2024)