EASE: Practical and Efficient Safety Alignment for Small Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Haonan, Wang, Guoli, Ouyang, Tu, Wang, An |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
by: Shi, Haonan, et al.
Published: (2025)
by: Shi, Haonan, et al.
Published: (2025)
Unveiling Client Privacy Leakage from Public Dataset Usage in Federated Distillation
by: Shi, Haonan, et al.
Published: (2025)
by: Shi, Haonan, et al.
Published: (2025)
Learning-Based Difficulty Calibration for Enhanced Membership Inference Attacks
by: Shi, Haonan, et al.
Published: (2024)
by: Shi, Haonan, et al.
Published: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
Lifelong Safety Alignment for Language Models
by: Wang, Haoyu, et al.
Published: (2025)
by: Wang, Haoyu, et al.
Published: (2025)
RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models
by: Liang, Jiacheng, et al.
Published: (2026)
by: Liang, Jiacheng, et al.
Published: (2026)
Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
by: Yuan, Shuai, et al.
Published: (2025)
by: Yuan, Shuai, et al.
Published: (2025)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
by: Wang, Guoli, et al.
Published: (2026)
by: Wang, Guoli, et al.
Published: (2026)
Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models
by: Chu, Fengheng, et al.
Published: (2026)
by: Chu, Fengheng, et al.
Published: (2026)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
by: Liu, Guozhi, et al.
Published: (2025)
by: Liu, Guozhi, et al.
Published: (2025)
Fail-Closed Alignment for Large Language Models
by: Coalson, Zachary, et al.
Published: (2026)
by: Coalson, Zachary, et al.
Published: (2026)
FlashDP: Private Training Large Language Models with Efficient DP-SGD
by: Wang, Liangyu, et al.
Published: (2025)
by: Wang, Liangyu, et al.
Published: (2025)
SelectFormer: Private and Practical Data Selection for Transformers
by: Ouyang, Xu, et al.
Published: (2023)
by: Ouyang, Xu, et al.
Published: (2023)
Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
by: Ding, Sihao
Published: (2026)
by: Ding, Sihao
Published: (2026)
Improving LLM Safety Alignment with Dual-Objective Optimization
by: Zhao, Xuandong, et al.
Published: (2025)
by: Zhao, Xuandong, et al.
Published: (2025)
Command-line Obfuscation Detection using Small Language Models
by: Outrata, Vojtech, et al.
Published: (2024)
by: Outrata, Vojtech, et al.
Published: (2024)
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
by: Liang, Jiacheng, et al.
Published: (2025)
by: Liang, Jiacheng, et al.
Published: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
by: Huang, Tiansheng, et al.
Published: (2025)
by: Huang, Tiansheng, et al.
Published: (2025)
Efficient and Effective Model Extraction
by: Zhu, Hongyu, et al.
Published: (2024)
by: Zhu, Hongyu, et al.
Published: (2024)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
by: Jin, Weifei, et al.
Published: (2025)
by: Jin, Weifei, et al.
Published: (2025)
Augmenting Parameter-Efficient Pre-trained Language Models with Large Language Models
by: Anand, Saurabh, et al.
Published: (2026)
by: Anand, Saurabh, et al.
Published: (2026)
MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment
by: Halloran, John
Published: (2025)
by: Halloran, John
Published: (2025)
AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
by: Zhang, Yi, et al.
Published: (2025)
by: Zhang, Yi, et al.
Published: (2025)
Poison with Style: A Practical Poisoning Attack on Code Large Language Models
by: Tran, Khang, et al.
Published: (2026)
by: Tran, Khang, et al.
Published: (2026)
Remote Timing Attacks on Efficient Language Model Inference
by: Carlini, Nicholas, et al.
Published: (2024)
by: Carlini, Nicholas, et al.
Published: (2024)
On Large Language Model Continual Unlearning
by: Gao, Chongyang, et al.
Published: (2024)
by: Gao, Chongyang, et al.
Published: (2024)
Information Leakage from Embedding in Large Language Models
by: Wan, Zhipeng, et al.
Published: (2024)
by: Wan, Zhipeng, et al.
Published: (2024)
N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
by: Lin, Zheyu, et al.
Published: (2025)
by: Lin, Zheyu, et al.
Published: (2025)
FedGA: Federated Learning with Gradient Alignment for Error Asymmetry Mitigation
by: Xiao, Chenguang, et al.
Published: (2024)
by: Xiao, Chenguang, et al.
Published: (2024)
JULI: Jailbreak Large Language Models by Self-Introspection
by: Wang, Jesson, et al.
Published: (2025)
by: Wang, Jesson, et al.
Published: (2025)
Efficient Differentially Private Fine-Tuning of Diffusion Models
by: Liu, Jing, et al.
Published: (2024)
by: Liu, Jing, et al.
Published: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
by: Wang, Xiangwen, et al.
Published: (2026)
by: Wang, Xiangwen, et al.
Published: (2026)
LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities
by: Nakka, Kalyan, et al.
Published: (2025)
by: Nakka, Kalyan, et al.
Published: (2025)
Representation Bending for Large Language Model Safety
by: Yousefpour, Ashkan, et al.
Published: (2025)
by: Yousefpour, Ashkan, et al.
Published: (2025)
A Fast, Performant, Secure Distributed Training Framework For Large Language Model
by: Huang, Wei, et al.
Published: (2024)
by: Huang, Wei, et al.
Published: (2024)
Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design
by: Eshuijs, Leon, et al.
Published: (2026)
by: Eshuijs, Leon, et al.
Published: (2026)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
by: Jiang, Fengqing, et al.
Published: (2025)
by: Jiang, Fengqing, et al.
Published: (2025)
Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment
by: Zaree, Pedram, et al.
Published: (2025)
by: Zaree, Pedram, et al.
Published: (2025)
Graph Unlearning with Efficient Partial Retraining
by: Zhang, Jiahao, et al.
Published: (2024)
by: Zhang, Jiahao, et al.
Published: (2024)
Similar Items
-
Navigating the Designs of Privacy-Preserving Fine-tuning for Large Language Models
by: Shi, Haonan, et al.
Published: (2025) -
Unveiling Client Privacy Leakage from Public Dataset Usage in Federated Distillation
by: Shi, Haonan, et al.
Published: (2025) -
Learning-Based Difficulty Calibration for Enhanced Membership Inference Attacks
by: Shi, Haonan, et al.
Published: (2024) -
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024) -
Lifelong Safety Alignment for Language Models
by: Wang, Haoyu, et al.
Published: (2025)