Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hsu, Chia-Yi, Tsai, Yu-Lin, Lin, Chih-Hsun, Chen, Pin-Yu, Yu, Chia-Mu, Huang, Chun-Ying |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
by: Hsu, Chia-Yi, et al.
Published: (2025)
by: Hsu, Chia-Yi, et al.
Published: (2025)
Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?
by: Tsai, Yu-Lin, et al.
Published: (2023)
by: Tsai, Yu-Lin, et al.
Published: (2023)
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
by: Lee, Yu-Ang, et al.
Published: (2026)
by: Lee, Yu-Ang, et al.
Published: (2026)
EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
by: Lin, Hsi-Che, et al.
Published: (2025)
by: Lin, Hsi-Che, et al.
Published: (2025)
BADTV: Unveiling Backdoor Threats in Third-Party Task Vectors
by: Hsu, Chia-Yi, et al.
Published: (2025)
by: Hsu, Chia-Yi, et al.
Published: (2025)
SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
by: Luo, Minrui, et al.
Published: (2025)
by: Luo, Minrui, et al.
Published: (2025)
Assertion Detection Large Language Model In-context Learning LoRA Fine-tuning
by: Ji, Yuelyu, et al.
Published: (2024)
by: Ji, Yuelyu, et al.
Published: (2024)
LoRA-BAM: Input Filtering for Fine-tuned LLMs via Boxed Abstraction Monitors over LoRA Layers
by: Wu, Changshun, et al.
Published: (2025)
by: Wu, Changshun, et al.
Published: (2025)
Poisoning Attacks to Local Differential Privacy Protocols for Trajectory Data
by: Hsu, I-Jung, et al.
Published: (2025)
by: Hsu, I-Jung, et al.
Published: (2025)
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
by: Feng, Zhi-Quan, et al.
Published: (2026)
by: Feng, Zhi-Quan, et al.
Published: (2026)
Kron-LoRA: Hybrid Kronecker-LoRA Adapters for Scalable, Sustainable Fine-tuning
by: Shen, Yixin
Published: (2025)
by: Shen, Yixin
Published: (2025)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
by: Hsu, Chia-Yi, et al.
Published: (2026)
by: Hsu, Chia-Yi, et al.
Published: (2026)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
by: Ran, Delong, et al.
Published: (2025)
by: Ran, Delong, et al.
Published: (2025)
Activated LoRA: Fine-tuned LLMs for Intrinsics
by: Greenewald, Kristjan, et al.
Published: (2025)
by: Greenewald, Kristjan, et al.
Published: (2025)
LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning
by: Zhang, Longteng, et al.
Published: (2023)
by: Zhang, Longteng, et al.
Published: (2023)
LoRA-Gen: Specializing Large Language Model via Online LoRA Generation
by: Xiao, Yicheng, et al.
Published: (2025)
by: Xiao, Yicheng, et al.
Published: (2025)
GeLoRA: Geometric Adaptive Ranks For Efficient LoRA Fine-tuning
by: Ed-dib, Abdessalam, et al.
Published: (2024)
by: Ed-dib, Abdessalam, et al.
Published: (2024)
Data Poisoning Attacks to Locally Differentially Private Range Query Protocols
by: Liao, Ting-Wei, et al.
Published: (2025)
by: Liao, Ting-Wei, et al.
Published: (2025)
LoRA vs Full Fine-tuning: An Illusion of Equivalence
by: Shuttleworth, Reece, et al.
Published: (2024)
by: Shuttleworth, Reece, et al.
Published: (2024)
DiffuseKronA: A Parameter Efficient Fine-tuning Method for Personalized Diffusion Models
by: Marjit, Shyam, et al.
Published: (2024)
by: Marjit, Shyam, et al.
Published: (2024)
Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
by: Zhang, Yuchen, et al.
Published: (2025)
by: Zhang, Yuchen, et al.
Published: (2025)
Safety Alignment Depth in Large Language Models: A Markov Chain Perspective
by: Kao, Ching-Chia, et al.
Published: (2025)
by: Kao, Ching-Chia, et al.
Published: (2025)
Heterogeneous LoRA for Federated Fine-tuning of On-Device Foundation Models
by: Cho, Yae Jee, et al.
Published: (2024)
by: Cho, Yae Jee, et al.
Published: (2024)
SCALE-LoRA: Auditing Post-Retrieval LoRA Composition with Residual Merging and View Reliability
by: Zhou, Shuaipeng, et al.
Published: (2026)
by: Zhou, Shuaipeng, et al.
Published: (2026)
Personalized LoRA for Human-Centered Text Understanding
by: Zhang, You, et al.
Published: (2024)
by: Zhang, You, et al.
Published: (2024)
LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B
by: Lermen, Simon, et al.
Published: (2023)
by: Lermen, Simon, et al.
Published: (2023)
FedLoDrop: Federated LoRA with Dropout for Generalized LLM Fine-tuning
by: Xie, Sijing, et al.
Published: (2025)
by: Xie, Sijing, et al.
Published: (2025)
SHE-LoRA: Selective Homomorphic Encryption for Federated Tuning with Heterogeneous LoRA
by: Liu, Jianmin, et al.
Published: (2025)
by: Liu, Jianmin, et al.
Published: (2025)
LoRA$^2$ : Multi-Scale Low-Rank Approximations for Fine-Tuning Large Language Models
by: Zhang, Jia-Chen, et al.
Published: (2024)
by: Zhang, Jia-Chen, et al.
Published: (2024)
CopRA: A Progressive LoRA Training Strategy
by: Zhuang, Zhan, et al.
Published: (2024)
by: Zhuang, Zhan, et al.
Published: (2024)
LoRA-FAIR: Federated LoRA Fine-Tuning with Aggregation and Initialization Refinement
by: Bian, Jieming, et al.
Published: (2024)
by: Bian, Jieming, et al.
Published: (2024)
CE-LoRA: Computation-Efficient LoRA Fine-Tuning for Language Models
by: Chen, Guanduo, et al.
Published: (2025)
by: Chen, Guanduo, et al.
Published: (2025)
HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization
by: Su, Yang, et al.
Published: (2024)
by: Su, Yang, et al.
Published: (2024)
Private LoRA Fine-tuning of Open-Source LLMs with Homomorphic Encryption
by: Frery, Jordan, et al.
Published: (2025)
by: Frery, Jordan, et al.
Published: (2025)
A Note on LoRA
by: Fomenko, Vlad, et al.
Published: (2024)
by: Fomenko, Vlad, et al.
Published: (2024)
Safe Pruning LoRA: Robust Distance-Guided Pruning for Safety Alignment in Adaptation of LLMs
by: Ao, Shuang, et al.
Published: (2025)
by: Ao, Shuang, et al.
Published: (2025)
Clinical Outcomes and Safety Profiles of Generic Versus Brand‐Name Clopidogrel in Patients Following Coronary Artery Stent Placement
by: Chin‐Yuan Chia, et al.
Published: (2025)
by: Chin‐Yuan Chia, et al.
Published: (2025)
NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs
by: Wang, Shuaidi, et al.
Published: (2026)
by: Wang, Shuaidi, et al.
Published: (2026)
LoRA+: Efficient Low Rank Adaptation of Large Models
by: Hayou, Soufiane, et al.
Published: (2024)
by: Hayou, Soufiane, et al.
Published: (2024)
S-LoRA: Serving Thousands of Concurrent LoRA Adapters
by: Sheng, Ying, et al.
Published: (2023)
by: Sheng, Ying, et al.
Published: (2023)
Similar Items
-
VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
by: Hsu, Chia-Yi, et al.
Published: (2025) -
Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models?
by: Tsai, Yu-Lin, et al.
Published: (2023) -
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
by: Lee, Yu-Ang, et al.
Published: (2026) -
EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
by: Lin, Hsi-Che, et al.
Published: (2025) -
BADTV: Unveiling Backdoor Threats in Third-Party Task Vectors
by: Hsu, Chia-Yi, et al.
Published: (2025)