SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Hao, An, Jingkun, Song, Zijun, Zhu, Pengyu, Li, Rui, Wang, Hao, Feng, Wendi, Liu, Yesheng, Li, Lijun, Yao, Jin-Ge, Sha, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs
por: Ghosh, Shaona, et al.
Publicado: (2025)
por: Ghosh, Shaona, et al.
Publicado: (2025)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
por: Zeng, Xiyu, et al.
Publicado: (2025)
por: Zeng, Xiyu, et al.
Publicado: (2025)
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
por: Zeng, Xinyi, et al.
Publicado: (2026)
por: Zeng, Xinyi, et al.
Publicado: (2026)
SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
por: Hao, Haochang, et al.
Publicado: (2026)
por: Hao, Haochang, et al.
Publicado: (2026)
Amortized Network Intervention to Steer the Excitatory Point Processes
por: Song, Zitao, et al.
Publicado: (2023)
por: Song, Zitao, et al.
Publicado: (2023)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
por: Zhang, Hongxiang, et al.
Publicado: (2024)
por: Zhang, Hongxiang, et al.
Publicado: (2024)
Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents
por: Li, Peiran, et al.
Publicado: (2026)
por: Li, Peiran, et al.
Publicado: (2026)
Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation
por: Fu, Yu, et al.
Publicado: (2026)
por: Fu, Yu, et al.
Publicado: (2026)
SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations
por: Chen, Zhaorun, et al.
Publicado: (2024)
por: Chen, Zhaorun, et al.
Publicado: (2024)
Multilingual Safety Alignment via Self-Distillation
por: Qin, Ruiyang, et al.
Publicado: (2026)
por: Qin, Ruiyang, et al.
Publicado: (2026)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
ROAST: Rollout-based On-distribution Activation Steering Technique
por: Su, Xuanbo, et al.
Publicado: (2026)
por: Su, Xuanbo, et al.
Publicado: (2026)
PsySafe: A Comprehensive Framework for Psychological-based Attack, Defense, and Evaluation of Multi-agent System Safety
por: Zhang, Zaibin, et al.
Publicado: (2024)
por: Zhang, Zaibin, et al.
Publicado: (2024)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
por: Zhang, Yitong, et al.
Publicado: (2025)
por: Zhang, Yitong, et al.
Publicado: (2025)
DA-Mamba: Learning Domain-Aware State Space Model for Global-Local Alignment in Domain Adaptive Object Detection
por: Li, Haochen, et al.
Publicado: (2026)
por: Li, Haochen, et al.
Publicado: (2026)
UEREBot: Learning Safe Quadrupedal Locomotion under Unstructured Environments and High-Speed Dynamic Obstacles
por: Xu, Zihao, et al.
Publicado: (2026)
por: Xu, Zihao, et al.
Publicado: (2026)
Effects of Low-Dose Recombinant Human Brain Natriuretic Peptide on Anterior Myocardial Infarction Complicated by Cardiogenic Shock
por: Yesheng Pan
Publicado: (2017)
por: Yesheng Pan
Publicado: (2017)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
por: Feng, Ruitao, et al.
Publicado: (2025)
por: Feng, Ruitao, et al.
Publicado: (2025)
Enhancing Peak Assignment in 13C NMR Spectroscopy: A Novel Approach Using Multimodal Alignment
por: Xu, Hao, et al.
Publicado: (2023)
por: Xu, Hao, et al.
Publicado: (2023)
Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment
por: Feng, Jingyuan, et al.
Publicado: (2026)
por: Feng, Jingyuan, et al.
Publicado: (2026)
2DNMRGym: An Annotated Experimental Dataset for Atom-Level Molecular Representation Learning in 2D NMR via Surrogate Supervision
por: Li, Yunrui, et al.
Publicado: (2025)
por: Li, Yunrui, et al.
Publicado: (2025)
Harnessing the Plug-and-Play Controller by Prompting
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
Policy Bifurcation in Safe Reinforcement Learning
por: Zou, Wenjun, et al.
Publicado: (2024)
por: Zou, Wenjun, et al.
Publicado: (2024)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
por: Li, Xin, et al.
Publicado: (2026)
por: Li, Xin, et al.
Publicado: (2026)
Engineering Epsilon‐Near‐Zero Media with Waveguides (Adv. Phys. Res. 9/2024)
por: Peihang Li, et al.
Publicado: (2024)
por: Peihang Li, et al.
Publicado: (2024)
Robust Tensor Completion via Gradient Tensor Nulclear L1-L2 Norm for Traffic Data Recovery
por: Shu, Hao, et al.
Publicado: (2025)
por: Shu, Hao, et al.
Publicado: (2025)
Interfacial Wetting and Erosion Behavior between Fluorine‐Free Slag and Submerged Entry Nozzle under an External Electric Field
por: Zijun Peng, et al.
Publicado: (2025)
por: Zijun Peng, et al.
Publicado: (2025)
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
por: Yin, Bo, et al.
Publicado: (2026)
por: Yin, Bo, et al.
Publicado: (2026)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
SafeWorld: Geo-Diverse Safety Alignment
por: Yin, Da, et al.
Publicado: (2024)
por: Yin, Da, et al.
Publicado: (2024)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
por: Rong, Xuankun, et al.
Publicado: (2025)
por: Rong, Xuankun, et al.
Publicado: (2025)
Steering benzyl alcohol electrooxidation coupled with hydrogen evolution via hetero‐interface construction
por: Xin Du, et al.
Publicado: (2024)
por: Xin Du, et al.
Publicado: (2024)
STARE at the Structure: Steering ICL Exemplar Selection with Structural Alignment
por: Li, Jiaqian, et al.
Publicado: (2025)
por: Li, Jiaqian, et al.
Publicado: (2025)
Ejemplares similares
-
SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs
por: Ghosh, Shaona, et al.
Publicado: (2025) -
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
por: Zeng, Xiyu, et al.
Publicado: (2025) -
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
por: Li, Hao, et al.
Publicado: (2025) -
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
por: Wang, Hao, et al.
Publicado: (2026) -
SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
por: Zeng, Xinyi, et al.
Publicado: (2026)