Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yuhang, Zhu, Yanxu, Lu, Dongyuan, Sang, Jitao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
von: Wang, Yuhang, et al.
Veröffentlicht: (2025)
von: Wang, Yuhang, et al.
Veröffentlicht: (2025)
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
von: Zhu, Yanxu, et al.
Veröffentlicht: (2024)
von: Zhu, Yanxu, et al.
Veröffentlicht: (2024)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
von: Wang, Yuhang, et al.
Veröffentlicht: (2024)
von: Wang, Yuhang, et al.
Veröffentlicht: (2024)
Inference-Time Rule Eraser: Fair Recognition via Distilling and Removing Biased Rules
von: Zhang, Yi, et al.
Veröffentlicht: (2024)
von: Zhang, Yi, et al.
Veröffentlicht: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
von: Wu, Di, et al.
Veröffentlicht: (2026)
von: Wu, Di, et al.
Veröffentlicht: (2026)
Safety Reasoning with Guidelines
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
von: Wang, Haoyu, et al.
Veröffentlicht: (2025)
Multilingual Safety Alignment via Self-Distillation
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
von: Qin, Ruiyang, et al.
Veröffentlicht: (2026)
Prescribing the Right Remedy: Mitigating Hallucinations in Large Vision-Language Models via Targeted Instruction Tuning
von: Hu, Rui, et al.
Veröffentlicht: (2024)
von: Hu, Rui, et al.
Veröffentlicht: (2024)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
von: In, Yeonjun, et al.
Veröffentlicht: (2025)
von: In, Yeonjun, et al.
Veröffentlicht: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
von: Mao, Yingzhi, et al.
Veröffentlicht: (2025)
von: Mao, Yingzhi, et al.
Veröffentlicht: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
von: Wang, Yanbo, et al.
Veröffentlicht: (2026)
von: Wang, Yanbo, et al.
Veröffentlicht: (2026)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
von: Zhong, Zhaofeng, et al.
Veröffentlicht: (2026)
von: Zhong, Zhaofeng, et al.
Veröffentlicht: (2026)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
von: Zhu, Zihao, et al.
Veröffentlicht: (2025)
von: Zhu, Zihao, et al.
Veröffentlicht: (2025)
CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records
von: Li, Dongchen, et al.
Veröffentlicht: (2025)
von: Li, Dongchen, et al.
Veröffentlicht: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
von: Yang, Tiankai, et al.
Veröffentlicht: (2026)
von: Yang, Tiankai, et al.
Veröffentlicht: (2026)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
von: Wang, Junyang, et al.
Veröffentlicht: (2025)
von: Wang, Junyang, et al.
Veröffentlicht: (2025)
On-the-fly Preference Alignment via Principle-Guided Decoding
von: Zhu, Mingye, et al.
Veröffentlicht: (2025)
von: Zhu, Mingye, et al.
Veröffentlicht: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
von: Cheng, Zehua, et al.
Veröffentlicht: (2026)
von: Cheng, Zehua, et al.
Veröffentlicht: (2026)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
von: Wang, Jiahao, et al.
Veröffentlicht: (2025)
Safety Alignment via Constrained Knowledge Unlearning
von: Shi, Zesheng, et al.
Veröffentlicht: (2025)
von: Shi, Zesheng, et al.
Veröffentlicht: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
von: Wang, Yixu, et al.
Veröffentlicht: (2026)
Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
von: Zhang, Chuyifei, et al.
Veröffentlicht: (2026)
von: Zhang, Chuyifei, et al.
Veröffentlicht: (2026)
Direct Alignment of Language Models via Quality-Aware Self-Refinement
von: Yu, Runsheng, et al.
Veröffentlicht: (2024)
von: Yu, Runsheng, et al.
Veröffentlicht: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
von: Wang, Yuhang, et al.
Veröffentlicht: (2023)
von: Wang, Yuhang, et al.
Veröffentlicht: (2023)
ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
von: Li, Changyi, et al.
Veröffentlicht: (2025)
von: Li, Changyi, et al.
Veröffentlicht: (2025)
SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment
von: Huang, Yuqing, et al.
Veröffentlicht: (2025)
von: Huang, Yuqing, et al.
Veröffentlicht: (2025)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling
von: Zhu, Alan, et al.
Veröffentlicht: (2026)
von: Zhu, Alan, et al.
Veröffentlicht: (2026)
ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
von: Zhang, Yize, et al.
Veröffentlicht: (2025)
von: Zhang, Yize, et al.
Veröffentlicht: (2025)
GEGA: Graph Convolutional Networks and Evidence Retrieval Guided Attention for Enhanced Document-level Relation Extraction
von: Mao, Yanxu, et al.
Veröffentlicht: (2024)
von: Mao, Yanxu, et al.
Veröffentlicht: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
von: Alssum, Lama, et al.
Veröffentlicht: (2025)
Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs with Minimal Human Interventions
von: Xu, Jingxin, et al.
Veröffentlicht: (2025)
von: Xu, Jingxin, et al.
Veröffentlicht: (2025)
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
von: Pei, Aihua, et al.
Veröffentlicht: (2024)
von: Pei, Aihua, et al.
Veröffentlicht: (2024)
Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
von: Zhu, Jason, et al.
Veröffentlicht: (2025)
von: Zhu, Jason, et al.
Veröffentlicht: (2025)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
von: Wang, Yuquan, et al.
Veröffentlicht: (2025)
von: Wang, Yuquan, et al.
Veröffentlicht: (2025)
SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs
von: Ryan, Michael J, et al.
Veröffentlicht: (2025)
von: Ryan, Michael J, et al.
Veröffentlicht: (2025)
Unifying Ontology Construction and Semantic Alignment for Deterministic Enterprise Reasoning at Scale
von: Zhu, Hongyin
Veröffentlicht: (2026)
von: Zhu, Hongyin
Veröffentlicht: (2026)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2023)
von: Khalifa, Muhammad, et al.
Veröffentlicht: (2023)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
von: Huang, Jiameng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
von: Wang, Yuhang, et al.
Veröffentlicht: (2025) -
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
von: Zhu, Yanxu, et al.
Veröffentlicht: (2024) -
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
von: Wang, Yuhang, et al.
Veröffentlicht: (2024) -
Inference-Time Rule Eraser: Fair Recognition via Distilling and Removing Biased Rules
von: Zhang, Yi, et al.
Veröffentlicht: (2024) -
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
von: Wu, Di, et al.
Veröffentlicht: (2026)