Understanding and Preserving Safety in Fine-Tuned LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jiawen, Hu, Yangfan, Chen, Kejia, He, Lipeng, Ma, Jiachen, Lou, Jian, Li, Dan, Liu, Jian, Yang, Xiaohu, Jia, Ruoxi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance
par: Zhang, Jiawen, et autres
Publié: (2026)
par: Zhang, Jiawen, et autres
Publié: (2026)
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
par: Zhang, Jiawen, et autres
Publié: (2025)
par: Zhang, Jiawen, et autres
Publié: (2025)
Confidence-Aware Alignment Makes Reasoning LLMs More Reliable
par: Chen, Kejia, et autres
Publié: (2026)
par: Chen, Kejia, et autres
Publié: (2026)
SecPE: Secure Prompt Ensembling for Private and Robust Large Language Models
par: Zhang, Jiawen, et autres
Publié: (2025)
par: Zhang, Jiawen, et autres
Publié: (2025)
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
par: Chen, Kejia, et autres
Publié: (2026)
par: Chen, Kejia, et autres
Publié: (2026)
SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Token-Level Inference-Time Alignment for Vision-Language Models
par: Chen, Kejia, et autres
Publié: (2025)
par: Chen, Kejia, et autres
Publié: (2025)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
par: Lu, Ning, et autres
Publié: (2025)
par: Lu, Ning, et autres
Publié: (2025)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
par: Asif, Sadia, et autres
Publié: (2026)
par: Asif, Sadia, et autres
Publié: (2026)
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning
par: Dabas, Mahavir, et autres
Publié: (2025)
par: Dabas, Mahavir, et autres
Publié: (2025)
How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
par: Zeng, Yi, et autres
Publié: (2024)
par: Zeng, Yi, et autres
Publié: (2024)
Get more for less: Principled Data Selection for Warming Up Fine-Tuning in LLMs
par: Kang, Feiyang, et autres
Publié: (2024)
par: Kang, Feiyang, et autres
Publié: (2024)
Trust & Safety of LLMs and LLMs in Trust & Safety
par: You, Doohee, et autres
Publié: (2024)
par: You, Doohee, et autres
Publié: (2024)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
par: Poppi, Samuele, et autres
Publié: (2024)
par: Poppi, Samuele, et autres
Publié: (2024)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Natural Language Fine-Tuning
par: Liu, Jia, et autres
Publié: (2024)
par: Liu, Jia, et autres
Publié: (2024)
Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization
par: Liu, Zhihao, et autres
Publié: (2026)
par: Liu, Zhihao, et autres
Publié: (2026)
TS-PEFT: Unveiling Token-Level Redundancy in Parameter-Efficient Fine-Tuning
par: Ma, Dabiao, et autres
Publié: (2025)
par: Ma, Dabiao, et autres
Publié: (2025)
Rotation-Preserving Supervised Fine-Tuning
par: Jin, Hangzhan, et autres
Publié: (2026)
par: Jin, Hangzhan, et autres
Publié: (2026)
FASTTRACK: Fast and Accurate Fact Tracing for LLMs
par: Chen, Si, et autres
Publié: (2024)
par: Chen, Si, et autres
Publié: (2024)
Aligning LLMs with Biomedical Knowledge using Balanced Fine-Tuning
par: Tang, Zhenchao, et autres
Publié: (2025)
par: Tang, Zhenchao, et autres
Publié: (2025)
CPCLDETECTOR: Knowledge Enhancement and Alignment Selection for Chinese Patronizing and Condescending Language Detection
par: Yang, Jiaxun, et autres
Publié: (2025)
par: Yang, Jiaxun, et autres
Publié: (2025)
LLMs Can Plan Only If We Tell Them
par: Sel, Bilgehan, et autres
Publié: (2025)
par: Sel, Bilgehan, et autres
Publié: (2025)
Zeroth-Order Fine-Tuning of LLMs in Random Subspaces
par: Yu, Ziming, et autres
Publié: (2024)
par: Yu, Ziming, et autres
Publié: (2024)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
par: ElZemity, Adel, et autres
Publié: (2025)
par: ElZemity, Adel, et autres
Publié: (2025)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
par: Pan, Birong, et autres
Publié: (2025)
par: Pan, Birong, et autres
Publié: (2025)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
par: Guo, Wentao, et autres
Publié: (2024)
par: Guo, Wentao, et autres
Publié: (2024)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
FedProxy: Federated Fine-Tuning of LLMs via Proxy SLMs and Heterogeneity-Aware Fusion
par: Fan, Tao, et autres
Publié: (2026)
par: Fan, Tao, et autres
Publié: (2026)
Robust and Efficient Zeroth-Order LLM Fine-Tuning via Adaptive Bayesian Subspace Optimizer
par: Feng, Jian, et autres
Publié: (2026)
par: Feng, Jian, et autres
Publié: (2026)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
par: Li, Ziniu, et autres
Publié: (2024)
par: Li, Ziniu, et autres
Publié: (2024)
Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
par: Taraghi, Mina, et autres
Publié: (2025)
par: Taraghi, Mina, et autres
Publié: (2025)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
Understanding and Guiding Layer Placement in Parameter-Efficient Fine-Tuning of Large Language Models
par: Xu, Yichen, et autres
Publié: (2026)
par: Xu, Yichen, et autres
Publié: (2026)
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
par: Chen, Yiwei, et autres
Publié: (2025)
par: Chen, Yiwei, et autres
Publié: (2025)
LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
par: Ma, Lipeng, et autres
Publié: (2025)
par: Ma, Lipeng, et autres
Publié: (2025)
DONOD: Efficient and Generalizable Instruction Fine-Tuning for LLMs via Model-Intrinsic Dataset Pruning
par: Hu, Jucheng, et autres
Publié: (2025)
par: Hu, Jucheng, et autres
Publié: (2025)
Documents similaires
-
Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance
par: Zhang, Jiawen, et autres
Publié: (2026) -
Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
par: Zhang, Jiawen, et autres
Publié: (2025) -
Confidence-Aware Alignment Makes Reasoning LLMs More Reliable
par: Chen, Kejia, et autres
Publié: (2026) -
SecPE: Secure Prompt Ensembling for Private and Robust Large Language Models
par: Zhang, Jiawen, et autres
Publié: (2025) -
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models
par: Chen, Kejia, et autres
Publié: (2025)