SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Feng, Kehua, Ding, Keyan, Wang, Yuhao, Li, Menghan, Wei, Fanjunduo, Wang, Xinda, Zhang, Qiang, Chen, Huajun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025)
by: Feng, Kehua, et al.
Published: (2025)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
by: Zhuang, Xiang, et al.
Published: (2025)
by: Zhuang, Xiang, et al.
Published: (2025)
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026)
by: Rao, Mingyang, et al.
Published: (2026)
Advancing biomolecular understanding and design following human instructions
by: Zhuang, Xiang, et al.
Published: (2024)
by: Zhuang, Xiang, et al.
Published: (2024)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
Enhancing Safe and Controllable Protein Generation via Knowledge Preference Optimization
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
by: Shi, Wei, et al.
Published: (2025)
by: Shi, Wei, et al.
Published: (2025)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
by: Luo, Shunyang, et al.
Published: (2026)
by: Luo, Shunyang, et al.
Published: (2026)
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
by: Yu, Jing, et al.
Published: (2025)
by: Yu, Jing, et al.
Published: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
by: Ding, Keyan, et al.
Published: (2025)
by: Ding, Keyan, et al.
Published: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Advancing LLM Safe Alignment with Safety Representation Ranking
by: Du, Tianqi, et al.
Published: (2025)
by: Du, Tianqi, et al.
Published: (2025)
Enrich-on-Graph: Query-Graph Alignment for Complex Reasoning with LLM Enriching
by: Li, Songze, et al.
Published: (2025)
by: Li, Songze, et al.
Published: (2025)
Multilingual Safety Alignment via Self-Distillation
by: Qin, Ruiyang, et al.
Published: (2026)
by: Qin, Ruiyang, et al.
Published: (2026)
Scientific Large Language Models: A Survey on Biological & Chemical Domains
by: Zhang, Qiang, et al.
Published: (2024)
by: Zhang, Qiang, et al.
Published: (2024)
A Bionic Natural Language Parser Equivalent to a Pushdown Automaton
by: Wei, Zhenghao, et al.
Published: (2024)
by: Wei, Zhenghao, et al.
Published: (2024)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
by: Chen, Yongrui, et al.
Published: (2025)
by: Chen, Yongrui, et al.
Published: (2025)
W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search
by: Ding, Zhenyu, et al.
Published: (2025)
by: Ding, Zhenyu, et al.
Published: (2025)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
by: Fan, Yuchun, et al.
Published: (2025)
by: Fan, Yuchun, et al.
Published: (2025)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
by: Mou, Yutao, et al.
Published: (2025)
by: Mou, Yutao, et al.
Published: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
STAIR: Improving Safety Alignment with Introspective Reasoning
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
by: Deng, Qiyuan, et al.
Published: (2025)
by: Deng, Qiyuan, et al.
Published: (2025)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
by: Lou, Xinyue, et al.
Published: (2025)
by: Lou, Xinyue, et al.
Published: (2025)
Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space
by: Zheng, Jiasen, et al.
Published: (2026)
by: Zheng, Jiasen, et al.
Published: (2026)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
by: In, Yeonjun, et al.
Published: (2025)
by: In, Yeonjun, et al.
Published: (2025)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
by: Wang, Yuhang, et al.
Published: (2025)
by: Wang, Yuhang, et al.
Published: (2025)
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
by: Jiang, Shuyang, et al.
Published: (2026)
by: Jiang, Shuyang, et al.
Published: (2026)
RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversals
by: Zhang, Xuanliang, et al.
Published: (2025)
by: Zhang, Xuanliang, et al.
Published: (2025)
RiOT: Efficient Prompt Refinement with Residual Optimization Tree
by: Zhou, Chenyi, et al.
Published: (2025)
by: Zhou, Chenyi, et al.
Published: (2025)
VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization
by: Chen, Menglan, et al.
Published: (2025)
by: Chen, Menglan, et al.
Published: (2025)
ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models
by: Liu, Yachuan, et al.
Published: (2025)
by: Liu, Yachuan, et al.
Published: (2025)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
by: She, Shuaijie, et al.
Published: (2024)
by: She, Shuaijie, et al.
Published: (2024)
Simple Techniques for Enhancing Sentence Embeddings in Generative Language Models
by: Zhang, Bowen, et al.
Published: (2024)
by: Zhang, Bowen, et al.
Published: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
by: Wu, Di, et al.
Published: (2026)
by: Wu, Di, et al.
Published: (2026)
Similar Items
-
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025) -
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025) -
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
by: Zhuang, Xiang, et al.
Published: (2025) -
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
by: Tang, Yuqi, et al.
Published: (2025) -
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026)