R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
Fuente:
arXiv
Guardado en:
| Autores principales: | In, Yeonjun, Kim, Wonjoong, Park, Sangwu, Park, Chanyoung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reasoning Structure Matters for Safety Alignment of Reasoning Models
por: In, Yeonjun, et al.
Publicado: (2026)
por: In, Yeonjun, et al.
Publicado: (2026)
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
por: Kim, Wonjoong, et al.
Publicado: (2025)
por: Kim, Wonjoong, et al.
Publicado: (2025)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
por: Kim, Wonjoong, et al.
Publicado: (2024)
por: Kim, Wonjoong, et al.
Publicado: (2024)
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
por: Kim, Wonjoong, et al.
Publicado: (2026)
por: Kim, Wonjoong, et al.
Publicado: (2026)
Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models
por: In, Yeonjun, et al.
Publicado: (2025)
por: In, Yeonjun, et al.
Publicado: (2025)
Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
por: In, Yeonjun, et al.
Publicado: (2026)
por: In, Yeonjun, et al.
Publicado: (2026)
Self-EvolveRec: Self-Evolving Recommender Systems with LLM-based Directional Feedback
por: Kim, Sein, et al.
Publicado: (2026)
por: Kim, Sein, et al.
Publicado: (2026)
Test-Time Training for Visual Foresight Vision-Language-Action Models
por: Park, Sangwu, et al.
Publicado: (2026)
por: Park, Sangwu, et al.
Publicado: (2026)
Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation
por: In, Yeonjun, et al.
Publicado: (2026)
por: In, Yeonjun, et al.
Publicado: (2026)
Revisiting Fake News Detection: Towards Temporality-aware Evaluation by Leveraging Engagement Earliness
por: Kim, Junghoon, et al.
Publicado: (2024)
por: Kim, Junghoon, et al.
Publicado: (2024)
DSLR: Diversity Enhancement and Structure Learning for Rehearsal-based Graph Continual Learning
por: Choi, Seungyoon, et al.
Publicado: (2024)
por: Choi, Seungyoon, et al.
Publicado: (2024)
CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space
por: Hwang, Yeonjun, et al.
Publicado: (2026)
por: Hwang, Yeonjun, et al.
Publicado: (2026)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
por: Yoon, Kanghoon, et al.
Publicado: (2025)
por: Yoon, Kanghoon, et al.
Publicado: (2025)
Safety Alignment via Constrained Knowledge Unlearning
por: Shi, Zesheng, et al.
Publicado: (2025)
por: Shi, Zesheng, et al.
Publicado: (2025)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
por: Wu, Di, et al.
Publicado: (2026)
por: Wu, Di, et al.
Publicado: (2026)
ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs
por: Park, Minbae, et al.
Publicado: (2025)
por: Park, Minbae, et al.
Publicado: (2025)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
por: Brito, Iago Alves, et al.
Publicado: (2026)
por: Brito, Iago Alves, et al.
Publicado: (2026)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
por: Alssum, Lama, et al.
Publicado: (2025)
por: Alssum, Lama, et al.
Publicado: (2025)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
SLM as Guardian: Pioneering AI Safety with Small Language Models
por: Kwon, Ohjoon, et al.
Publicado: (2024)
por: Kwon, Ohjoon, et al.
Publicado: (2024)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
por: Zhu, Zihao, et al.
Publicado: (2025)
por: Zhu, Zihao, et al.
Publicado: (2025)
Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment
por: Wang, Haoran, et al.
Publicado: (2023)
por: Wang, Haoran, et al.
Publicado: (2023)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
por: Li, Jianwei, et al.
Publicado: (2025)
por: Li, Jianwei, et al.
Publicado: (2025)
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
por: Choi, Dasol, et al.
Publicado: (2026)
por: Choi, Dasol, et al.
Publicado: (2026)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
por: Zhang, Jingyu, et al.
Publicado: (2024)
por: Zhang, Jingyu, et al.
Publicado: (2024)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
por: Lee, Gisang, et al.
Publicado: (2024)
por: Lee, Gisang, et al.
Publicado: (2024)
InvThink: Premortem Reasoning for Safer Language Models
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
por: Kim, Kibum, et al.
Publicado: (2024)
por: Kim, Kibum, et al.
Publicado: (2024)
THINKSAFE: Self-Generated Safety Alignment for Reasoning Models
por: Lee, Seanie, et al.
Publicado: (2026)
por: Lee, Seanie, et al.
Publicado: (2026)
Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
por: Sreedhar, Makesh Narsimhan, et al.
Publicado: (2025)
Towards Context-Invariant Safety Alignment for Large Language Models
por: Wang, Yixu, et al.
Publicado: (2026)
por: Wang, Yixu, et al.
Publicado: (2026)
Superficial Safety Alignment Hypothesis
por: Li, Jianwei, et al.
Publicado: (2024)
por: Li, Jianwei, et al.
Publicado: (2024)
Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance
por: Hu, Wenbin, et al.
Publicado: (2025)
por: Hu, Wenbin, et al.
Publicado: (2025)
ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models
por: Li, Changyi, et al.
Publicado: (2025)
por: Li, Changyi, et al.
Publicado: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
por: Yang, Tiankai, et al.
Publicado: (2026)
por: Yang, Tiankai, et al.
Publicado: (2026)
SafeWorld: Geo-Diverse Safety Alignment
por: Yin, Da, et al.
Publicado: (2024)
por: Yin, Da, et al.
Publicado: (2024)
Hierarchical Deconstruction of LLM Reasoning: A Graph-Based Framework for Analyzing Knowledge Utilization
por: Ko, Miyoung, et al.
Publicado: (2024)
por: Ko, Miyoung, et al.
Publicado: (2024)
Improving Multi-hop Logical Reasoning in Knowledge Graphs with Context-Aware Query Representation Learning
por: Kim, Jeonghoon, et al.
Publicado: (2024)
por: Kim, Jeonghoon, et al.
Publicado: (2024)
Ejemplares similares
-
Reasoning Structure Matters for Safety Alignment of Reasoning Models
por: In, Yeonjun, et al.
Publicado: (2026) -
Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents
por: Kim, Wonjoong, et al.
Publicado: (2025) -
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
por: Kim, Wonjoong, et al.
Publicado: (2024) -
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
por: Kim, Wonjoong, et al.
Publicado: (2026) -
Is Safety Standard Same for Everyone? User-Specific Safety Evaluation of Large Language Models
por: In, Yeonjun, et al.
Publicado: (2025)