Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study
Fuente:
arXiv
Saved in:
| Main Authors: | Ponkshe, Kaustubh, Shah, Shaan, Singhal, Raghav, Vepakomma, Praneeth |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
by: Singhal, Raghav, et al.
Published: (2025)
by: Singhal, Raghav, et al.
Published: (2025)
Initialization using Update Approximation is a Silver Bullet for Extremely Efficient Low-Rank Fine-Tuning
by: Ponkshe, Kaustubh, et al.
Published: (2024)
by: Ponkshe, Kaustubh, et al.
Published: (2024)
Fed-SB: A Silver Bullet for Extreme Communication Efficiency and Performance in (Private) Federated LoRA Fine-Tuning
by: Singhal, Raghav, et al.
Published: (2025)
by: Singhal, Raghav, et al.
Published: (2025)
FedEx-LoRA: Exact Aggregation for Federated and Efficient Fine-Tuning of Foundation Models
by: Singhal, Raghav, et al.
Published: (2024)
by: Singhal, Raghav, et al.
Published: (2024)
Power Mechanism: Private Tabular Representation Release for Model Agnostic Consumption
by: Vepakomma, Praneeth, et al.
Published: (2025)
by: Vepakomma, Praneeth, et al.
Published: (2025)
DP-Fusion: Token-Level Differentially Private Inference for Large Language Models
by: Thareja, Rushil, et al.
Published: (2025)
by: Thareja, Rushil, et al.
Published: (2025)
ROSA: Random Subspace Adaptation for Efficient Fine-Tuning
by: Hameed, Marawan Gamal Abdel, et al.
Published: (2024)
by: Hameed, Marawan Gamal Abdel, et al.
Published: (2024)
Predicting Survival of Hemodialysis Patients using Federated Learning
by: Raju, Abhiram, et al.
Published: (2024)
by: Raju, Abhiram, et al.
Published: (2024)
From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation
by: Kiulian, Artur, et al.
Published: (2024)
by: Kiulian, Artur, et al.
Published: (2024)
Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs
by: Giordani, Jeremiah
Published: (2025)
by: Giordani, Jeremiah
Published: (2025)
NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
by: Pan, Birong, et al.
Published: (2025)
by: Pan, Birong, et al.
Published: (2025)
Linear Chain Transformation: Expanding Optimization Dynamics for Fine-Tuning Large Language Models
by: Wang, Yulong, et al.
Published: (2024)
by: Wang, Yulong, et al.
Published: (2024)
A Lightweight Method to Disrupt Memorized Sequences in LLM
by: Prashant, Parjanya Prajakta, et al.
Published: (2025)
by: Prashant, Parjanya Prajakta, et al.
Published: (2025)
Fine-Tune an SLM or Prompt an LLM? The Case of Generating Low-Code Workflows
by: Ayala, Orlando Marquez, et al.
Published: (2025)
by: Ayala, Orlando Marquez, et al.
Published: (2025)
HSplitLoRA: A Heterogeneous Split Parameter-Efficient Fine-Tuning Framework for Large Language Models
by: Lin, Zheng, et al.
Published: (2025)
by: Lin, Zheng, et al.
Published: (2025)
Regularization Through Reasoning: Systematic Improvements in Language Model Classification via Explanation-Enhanced Fine-Tuning
by: Shah, Vivswan, et al.
Published: (2025)
by: Shah, Vivswan, et al.
Published: (2025)
Resolving Intent Ambiguities by Retrieving Discriminative Clarifying Questions
by: Dhole, Kaustubh D.
Published: (2020)
by: Dhole, Kaustubh D.
Published: (2020)
Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
by: Wang, Dianyun, et al.
Published: (2025)
by: Wang, Dianyun, et al.
Published: (2025)
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety
by: Shen, Qian, et al.
Published: (2026)
by: Shen, Qian, et al.
Published: (2026)
Proximal Supervised Fine-Tuning
by: Zhu, Wenhong, et al.
Published: (2025)
by: Zhu, Wenhong, et al.
Published: (2025)
A Multi-Encoder Frozen-Decoder Approach for Fine-Tuning Large Language Models
by: Dhole, Kaustubh D.
Published: (2025)
by: Dhole, Kaustubh D.
Published: (2025)
LML-DAP: Language Model Learning a Dataset for Data-Augmented Prediction
by: Vadlapati, Praneeth
Published: (2024)
by: Vadlapati, Praneeth
Published: (2024)
Order-Independence Without Fine Tuning
by: McIlroy-Young, Reid, et al.
Published: (2024)
by: McIlroy-Young, Reid, et al.
Published: (2024)
Model Editing by Standard Fine-Tuning
by: Gangadhar, Govind, et al.
Published: (2024)
by: Gangadhar, Govind, et al.
Published: (2024)
Offline and Online KL-Regularized RLHF under Differential Privacy
by: Wu, Yulian, et al.
Published: (2025)
by: Wu, Yulian, et al.
Published: (2025)
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
by: Li, Guanlin, et al.
Published: (2025)
by: Li, Guanlin, et al.
Published: (2025)
Parameter-Efficient Fine-Tuning for Foundation Models
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
by: Sun, Hao
Published: (2024)
by: Sun, Hao
Published: (2024)
Boosting Large Language Models with Mask Fine-Tuning
by: Zhang, Mingyuan, et al.
Published: (2025)
by: Zhang, Mingyuan, et al.
Published: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
by: Huang, Zeyu, et al.
Published: (2025)
by: Huang, Zeyu, et al.
Published: (2025)
Teaching LLMs How to Learn with Contextual Fine-Tuning
by: Choi, Younwoo, et al.
Published: (2025)
by: Choi, Younwoo, et al.
Published: (2025)
Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory
by: Singh, Sanyam, et al.
Published: (2026)
by: Singh, Sanyam, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
by: Gao, Ziqi, et al.
Published: (2024)
by: Gao, Ziqi, et al.
Published: (2024)
Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs
by: Ovadia, Oded, et al.
Published: (2023)
by: Ovadia, Oded, et al.
Published: (2023)
Fine-Tuning Language Models with Reward Learning on Policy
by: Lang, Hao, et al.
Published: (2024)
by: Lang, Hao, et al.
Published: (2024)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
by: Xia, Yuchen, et al.
Published: (2024)
by: Xia, Yuchen, et al.
Published: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
by: Ansell, Alan, et al.
Published: (2024)
by: Ansell, Alan, et al.
Published: (2024)
Instruction Fine-Tuning: Does Prompt Loss Matter?
by: Huerta-Enochian, Mathew, et al.
Published: (2024)
by: Huerta-Enochian, Mathew, et al.
Published: (2024)
Fine-Tuning Improves Information Conveyance in Language Models
by: Cheng, Yuwei, et al.
Published: (2026)
by: Cheng, Yuwei, et al.
Published: (2026)
SVFT: Parameter-Efficient Fine-Tuning with Singular Vectors
by: Lingam, Vijay, et al.
Published: (2024)
by: Lingam, Vijay, et al.
Published: (2024)
Similar Items
-
ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
by: Singhal, Raghav, et al.
Published: (2025) -
Initialization using Update Approximation is a Silver Bullet for Extremely Efficient Low-Rank Fine-Tuning
by: Ponkshe, Kaustubh, et al.
Published: (2024) -
Fed-SB: A Silver Bullet for Extreme Communication Efficiency and Performance in (Private) Federated LoRA Fine-Tuning
by: Singhal, Raghav, et al.
Published: (2025) -
FedEx-LoRA: Exact Aggregation for Federated and Efficient Fine-Tuning of Foundation Models
by: Singhal, Raghav, et al.
Published: (2024) -
Power Mechanism: Private Tabular Representation Release for Model Agnostic Consumption
by: Vepakomma, Praneeth, et al.
Published: (2025)