Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yuhang, Zhu, Yanxu, Lu, Dongyuan, Sang, Jitao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024)
par: Zhu, Yanxu, et autres
Publié: (2024)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
par: Wang, Yuhang, et autres
Publié: (2024)
par: Wang, Yuhang, et autres
Publié: (2024)
Inference-Time Rule Eraser: Fair Recognition via Distilling and Removing Biased Rules
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
par: Wu, Di, et autres
Publié: (2026)
par: Wu, Di, et autres
Publié: (2026)
Safety Reasoning with Guidelines
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Multilingual Safety Alignment via Self-Distillation
par: Qin, Ruiyang, et autres
Publié: (2026)
par: Qin, Ruiyang, et autres
Publié: (2026)
Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning
par: Hu, Rui, et autres
Publié: (2024)
par: Hu, Rui, et autres
Publié: (2024)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
par: In, Yeonjun, et autres
Publié: (2025)
par: In, Yeonjun, et autres
Publié: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
par: Mao, Yingzhi, et autres
Publié: (2025)
par: Mao, Yingzhi, et autres
Publié: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
par: Wang, Yanbo, et autres
Publié: (2026)
par: Wang, Yanbo, et autres
Publié: (2026)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
par: Zhong, Zhaofeng, et autres
Publié: (2026)
par: Zhong, Zhaofeng, et autres
Publié: (2026)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
par: Zhu, Zihao, et autres
Publié: (2025)
par: Zhu, Zihao, et autres
Publié: (2025)
CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records
par: Li, Dongchen, et autres
Publié: (2025)
par: Li, Dongchen, et autres
Publié: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
par: Yang, Tiankai, et autres
Publié: (2026)
par: Yang, Tiankai, et autres
Publié: (2026)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
par: Wang, Junyang, et autres
Publié: (2025)
par: Wang, Junyang, et autres
Publié: (2025)
On-the-fly Preference Alignment via Principle-Guided Decoding
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
par: Cheng, Zehua, et autres
Publié: (2026)
par: Cheng, Zehua, et autres
Publié: (2026)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
Safety Alignment via Constrained Knowledge Unlearning
par: Shi, Zesheng, et autres
Publié: (2025)
par: Shi, Zesheng, et autres
Publié: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
par: Wang, Yixu, et autres
Publié: (2026)
par: Wang, Yixu, et autres
Publié: (2026)
Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
par: Zhang, Chuyifei, et autres
Publié: (2026)
par: Zhang, Chuyifei, et autres
Publié: (2026)
Direct Alignment of Language Models via Quality-Aware Self-Refinement
par: Yu, Runsheng, et autres
Publié: (2024)
par: Yu, Runsheng, et autres
Publié: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
par: Fan, Yuchun, et autres
Publié: (2025)
par: Fan, Yuchun, et autres
Publié: (2025)
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
par: Wang, Yuhang, et autres
Publié: (2023)
par: Wang, Yuhang, et autres
Publié: (2023)
ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
par: Li, Changyi, et autres
Publié: (2025)
par: Li, Changyi, et autres
Publié: (2025)
SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment
par: Huang, Yuqing, et autres
Publié: (2025)
par: Huang, Yuqing, et autres
Publié: (2025)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
par: Huang, Jianheng, et autres
Publié: (2024)
par: Huang, Jianheng, et autres
Publié: (2024)
Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling
par: Zhu, Alan, et autres
Publié: (2026)
par: Zhu, Alan, et autres
Publié: (2026)
ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
par: Zhang, Yize, et autres
Publié: (2025)
par: Zhang, Yize, et autres
Publié: (2025)
GEGA: Graph Convolutional Networks and Evidence Retrieval Guided Attention for Enhanced Document-level Relation Extraction
par: Mao, Yanxu, et autres
Publié: (2024)
par: Mao, Yanxu, et autres
Publié: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
par: Alssum, Lama, et autres
Publié: (2025)
par: Alssum, Lama, et autres
Publié: (2025)
Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs with Minimal Human Interventions
par: Xu, Jingxin, et autres
Publié: (2025)
par: Xu, Jingxin, et autres
Publié: (2025)
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
par: Zhu, Jason, et autres
Publié: (2025)
par: Zhu, Jason, et autres
Publié: (2025)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
par: Wang, Yuquan, et autres
Publié: (2025)
par: Wang, Yuquan, et autres
Publié: (2025)
SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs
par: Ryan, Michael J, et autres
Publié: (2025)
par: Ryan, Michael J, et autres
Publié: (2025)
Unifying Ontology Construction and Semantic Alignment for Deterministic Enterprise Reasoning at Scale
par: Zhu, Hongyin
Publié: (2026)
par: Zhu, Hongyin
Publié: (2026)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
par: Khalifa, Muhammad, et autres
Publié: (2023)
par: Khalifa, Muhammad, et autres
Publié: (2023)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
Documents similaires
-
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
par: Wang, Yuhang, et autres
Publié: (2025) -
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024) -
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
par: Wang, Yuhang, et autres
Publié: (2024) -
Inference-Time Rule Eraser: Fair Recognition via Distilling and Removing Biased Rules
par: Zhang, Yi, et autres
Publié: (2024) -
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
par: Wu, Di, et autres
Publié: (2026)