Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mou, Yutao, Zhou, Xiaoling, Luo, Yuxiao, Zhang, Shikun, Ye, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective
par: Mou, Yutao, et autres
Publié: (2025)
par: Mou, Yutao, et autres
Publié: (2025)
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
par: Mou, Yutao, et autres
Publié: (2024)
par: Mou, Yutao, et autres
Publié: (2024)
ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback
par: Mou, Yutao, et autres
Publié: (2026)
par: Mou, Yutao, et autres
Publié: (2026)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
par: Alssum, Lama, et autres
Publié: (2025)
par: Alssum, Lama, et autres
Publié: (2025)
Scale-Distribution Decoupling: Enabling Stable and Effective Training of Large Language Models
par: Wang, Ya, et autres
Publié: (2025)
par: Wang, Ya, et autres
Publié: (2025)
MPL: Multiple Programming Languages with Large Language Models for Information Extraction
par: Li, Bo, et autres
Publié: (2025)
par: Li, Bo, et autres
Publié: (2025)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
O-Edit: Orthogonal Subspace Editing for Language Model Sequential Editing
par: Cai, Yuchen, et autres
Publié: (2024)
par: Cai, Yuchen, et autres
Publié: (2024)
ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models
par: Li, Chen, et autres
Publié: (2026)
par: Li, Chen, et autres
Publié: (2026)
OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model Merging
par: Zhang, Haobo, et autres
Publié: (2025)
par: Zhang, Haobo, et autres
Publié: (2025)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
par: Zhu, Yu, et autres
Publié: (2024)
par: Zhu, Yu, et autres
Publié: (2024)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
par: Deng, Qiyuan, et autres
Publié: (2025)
par: Deng, Qiyuan, et autres
Publié: (2025)
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
par: Tan, Chenkun, et autres
Publié: (2025)
par: Tan, Chenkun, et autres
Publié: (2025)
SOMP: Scalable Gradient Inversion for Large Language Models via Subspace-Guided Orthogonal Matching Pursuit
par: Li, Yibo, et autres
Publié: (2026)
par: Li, Yibo, et autres
Publié: (2026)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future
par: Wang, Yidong, et autres
Publié: (2025)
par: Wang, Yidong, et autres
Publié: (2025)
Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching
par: Zhao, Weixiang, et autres
Publié: (2024)
par: Zhao, Weixiang, et autres
Publié: (2024)
Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions
par: Zhang, Xiaoyun, et autres
Publié: (2024)
par: Zhang, Xiaoyun, et autres
Publié: (2024)
Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection
par: Sun, Guanglong, et autres
Publié: (2026)
par: Sun, Guanglong, et autres
Publié: (2026)
Parameter-Efficient Fine-Tuning of Large Language Models via Deconvolution in Subspace
par: Zhang, Jia-Chen, et autres
Publié: (2025)
par: Zhang, Jia-Chen, et autres
Publié: (2025)
SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces
par: Liu, Ruiheng, et autres
Publié: (2025)
par: Liu, Ruiheng, et autres
Publié: (2025)
Compositional Subspace Representation Fine-tuning for Adaptive Large Language Models
par: Zhou, Andy
Publié: (2025)
par: Zhou, Andy
Publié: (2025)
GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
par: Fang, Zhouxiang, et autres
Publié: (2026)
par: Fang, Zhouxiang, et autres
Publié: (2026)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
par: Wu, Yuhang, et autres
Publié: (2024)
par: Wu, Yuhang, et autres
Publié: (2024)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
par: Djuhera, Aladin, et autres
Publié: (2025)
par: Djuhera, Aladin, et autres
Publié: (2025)
Latent Distance Guided Alignment Training for Large Language Models
par: Luo, Haotian
Publié: (2024)
par: Luo, Haotian
Publié: (2024)
BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
par: Yi, Xin, et autres
Publié: (2024)
par: Yi, Xin, et autres
Publié: (2024)
SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Towards Efficient and Effective Alignment of Large Language Models
par: Jiang, Yuxin
Publié: (2025)
par: Jiang, Yuxin
Publié: (2025)
Alignment for Efficient Tool Calling of Large Language Models
par: Xu, Hongshen, et autres
Publié: (2025)
par: Xu, Hongshen, et autres
Publié: (2025)
Knowledge Editing on Black-box Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
Towards Context-Invariant Safety Alignment for Large Language Models
par: Wang, Yixu, et autres
Publié: (2026)
par: Wang, Yixu, et autres
Publié: (2026)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions
par: Pan, Wenbo, et autres
Publié: (2025)
par: Pan, Wenbo, et autres
Publié: (2025)
Documents similaires
-
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
par: Mou, Yutao, et autres
Publié: (2025) -
Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective
par: Mou, Yutao, et autres
Publié: (2025) -
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
par: Mou, Yutao, et autres
Publié: (2024) -
ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback
par: Mou, Yutao, et autres
Publié: (2026) -
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
par: Alssum, Lama, et autres
Publié: (2025)