AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Shuo, Zhang, Qihui, Liu, Yuyang, Jia, Xiaojun, Ning, Kunpeng, Yao, Jiayu, Wang, Jigang, Dai, Hailiang, Song, Yibing, Yuan, Li |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents
by: Gulati, Idhant, et al.
Published: (2026)
by: Gulati, Idhant, et al.
Published: (2026)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
by: Giordani, Jeremiah
Published: (2025)
by: Giordani, Jeremiah
Published: (2025)
RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
by: Xu, Meilong, et al.
Published: (2025)
by: Xu, Meilong, et al.
Published: (2025)
Secure LLM Fine-Tuning via Safety-Aware Probing
by: Wu, Chengcan, et al.
Published: (2025)
by: Wu, Chengcan, et al.
Published: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
by: Zhang, Jiawen, et al.
Published: (2026)
by: Zhang, Jiawen, et al.
Published: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
by: Li, Qizheng, et al.
Published: (2026)
by: Li, Qizheng, et al.
Published: (2026)
SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
by: Hossain, Saad, et al.
Published: (2025)
by: Hossain, Saad, et al.
Published: (2025)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
by: Zhang, Yuyou, et al.
Published: (2025)
by: Zhang, Yuyou, et al.
Published: (2025)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
by: Hou, Yutao, et al.
Published: (2026)
by: Hou, Yutao, et al.
Published: (2026)
ReFT: Reasoning with Reinforced Fine-Tuning
by: Luong, Trung Quoc, et al.
Published: (2024)
by: Luong, Trung Quoc, et al.
Published: (2024)
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
by: Chen, Yiwei, et al.
Published: (2025)
by: Chen, Yiwei, et al.
Published: (2025)
S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain
by: Zhang, Baoquan, et al.
Published: (2026)
by: Zhang, Baoquan, et al.
Published: (2026)
Self-Mined Hardness for Safety Fine-Tuning
by: Gupta, Prakhar, et al.
Published: (2026)
by: Gupta, Prakhar, et al.
Published: (2026)
Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning
by: Mahmud, Al Jaber, et al.
Published: (2026)
by: Mahmud, Al Jaber, et al.
Published: (2026)
Anchored Supervised Fine-Tuning
by: Zhu, He, et al.
Published: (2025)
by: Zhu, He, et al.
Published: (2025)
Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
by: Du, Yanrui, et al.
Published: (2025)
by: Du, Yanrui, et al.
Published: (2025)
AutoFT: Learning an Objective for Robust Fine-Tuning
by: Choi, Caroline, et al.
Published: (2024)
by: Choi, Caroline, et al.
Published: (2024)
GiFT: Gibbs Fine-Tuning for Code Generation
by: Li, Haochen, et al.
Published: (2025)
by: Li, Haochen, et al.
Published: (2025)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
by: Zhang, Junbo, et al.
Published: (2026)
by: Zhang, Junbo, et al.
Published: (2026)
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
by: Hossain, Saad, et al.
Published: (2026)
by: Hossain, Saad, et al.
Published: (2026)
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
by: Bach, Thong, et al.
Published: (2025)
by: Bach, Thong, et al.
Published: (2025)
Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency
by: Fraser, Kathleen C., et al.
Published: (2025)
by: Fraser, Kathleen C., et al.
Published: (2025)
Safety-Aware Fine-Tuning of Large Language Models
by: Choi, Hyeong Kyu, et al.
Published: (2024)
by: Choi, Hyeong Kyu, et al.
Published: (2024)
Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance
by: Zhang, Jiawen, et al.
Published: (2026)
by: Zhang, Jiawen, et al.
Published: (2026)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
by: Lu, Ning, et al.
Published: (2025)
by: Lu, Ning, et al.
Published: (2025)
LLM Safety From Within: Detecting Harmful Content with Internal Representations
by: Jiao, Difan, et al.
Published: (2026)
by: Jiao, Difan, et al.
Published: (2026)
RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
by: Asif, Sadia, et al.
Published: (2026)
by: Asif, Sadia, et al.
Published: (2026)
Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs
by: Roh, Jaechul, et al.
Published: (2026)
by: Roh, Jaechul, et al.
Published: (2026)
The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety
by: Springer, Max, et al.
Published: (2026)
by: Springer, Max, et al.
Published: (2026)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
by: Ding, Yi, et al.
Published: (2025)
by: Ding, Yi, et al.
Published: (2025)
WeGeFT: Weight-Generative Fine-Tuning for Multi-Faceted Efficient Adaptation of Large Models
by: Savadikar, Chinmay, et al.
Published: (2023)
by: Savadikar, Chinmay, et al.
Published: (2023)
S$^{2}$FT: Efficient, Scalable and Generalizable LLM Fine-tuning by Structured Sparsity
by: Yang, Xinyu, et al.
Published: (2024)
by: Yang, Xinyu, et al.
Published: (2024)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
by: Kim, Jaehan, et al.
Published: (2025)
by: Kim, Jaehan, et al.
Published: (2025)
SCoFT: Self-Contrastive Fine-Tuning for Equitable Image Generation
by: Liu, Zhixuan, et al.
Published: (2024)
by: Liu, Zhixuan, et al.
Published: (2024)
HiFT: A Hierarchical Full Parameter Fine-Tuning Strategy
by: Liu, Yongkang, et al.
Published: (2024)
by: Liu, Yongkang, et al.
Published: (2024)
NeST: Neuron Selective Tuning for LLM Safety
by: Behrouzi, Sasha, et al.
Published: (2026)
by: Behrouzi, Sasha, et al.
Published: (2026)
Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
by: Kim, Minseon, et al.
Published: (2025)
by: Kim, Minseon, et al.
Published: (2025)
SWiFT: Soft-Mask Weight Fine-tuning for Bias Mitigation
by: Yan, Junyu, et al.
Published: (2025)
by: Yan, Junyu, et al.
Published: (2025)
Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study
by: Ponkshe, Kaustubh, et al.
Published: (2025)
by: Ponkshe, Kaustubh, et al.
Published: (2025)
Remote ID Based UAV Collision Avoidance Optimization for Low-Altitude Airspace Safety
by: Jia, Ziye, et al.
Published: (2025)
by: Jia, Ziye, et al.
Published: (2025)
Similar Items
-
Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents
by: Gulati, Idhant, et al.
Published: (2026) -
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
by: Giordani, Jeremiah
Published: (2025) -
RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
by: Xu, Meilong, et al.
Published: (2025) -
Secure LLM Fine-Tuning via Safety-Aware Probing
by: Wu, Chengcan, et al.
Published: (2025) -
Understanding and Preserving Safety in Fine-Tuned LLMs
by: Zhang, Jiawen, et al.
Published: (2026)