Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
Fuente:
arXiv
Saved in:
| Main Authors: | Lu, Haoran, Fang, Luyang, Zhang, Ruidong, Li, Xinliang, Cai, Jiazhang, Cheng, Huimin, Tang, Lin, Liu, Ziyu, Sun, Zeliang, Wang, Tao, Zhang, Yingchuan, Zidan, Arif Hassan, Xu, Jinwen, Yu, Jincheng, Yu, Meizhi, Jiang, Hanqi, Gong, Xilin, Luo, Weidi, Sun, Bolun, Chen, Yongkai, Ma, Terry, Wu, Shushan, Zhou, Yifan, Chen, Junhao, Xiang, Haotian, Zhang, Jing, Jahin, Afrar, Ruan, Wei, Deng, Ke, Pan, Yi, Wang, Peilong, Li, Jiahui, Liu, Zhengliang, Zhang, Lu, Zhao, Lin, Liu, Wei, Zhu, Dajiang, Xing, Xin, Dou, Fei, Zhang, Wei, Huang, Chao, Liu, Rongjie, Zhang, Mengrui, Liu, Yiwen, Sun, Xiaoxiao, Lu, Qin, Xiang, Zhen, Zhong, Wenxuan, Liu, Tianming, Ma, Ping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Mathematical Reasoning Across Large Language Models: A Fine-Grained Approach
by: Jahin, Afrar, et al.
Published: (2025)
by: Jahin, Afrar, et al.
Published: (2025)
HOME-3: High-Order Momentum Estimator with Third-Power Gradient for Convex and Smooth Nonconvex Optimization
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Permutation Randomization on Nonsmooth Nonconvex Optimization: A Theoretical and Experimental Study
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Quantum-Classical Hybrid Molecular Autoencoder for Advancing Classical Decoding
by: Jahin, Afrar, et al.
Published: (2025)
by: Jahin, Afrar, et al.
Published: (2025)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
by: Lyu, Yanjun, et al.
Published: (2024)
by: Lyu, Yanjun, et al.
Published: (2024)
Assessing the Impact of Burnout on Nurse Safety Behaviors and Patient Safety Competence: A Latent Profile Analysis Study
by: Fengyan Ma, et al.
Published: (2025)
by: Fengyan Ma, et al.
Published: (2025)
Green Rail Equipment Safety Prediction Integrating Few‐Shot Learning and Deep Models
by: Wenjie Sun, et al.
Published: (2025)
by: Wenjie Sun, et al.
Published: (2025)
Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions
by: Fang, Luyang, et al.
Published: (2025)
by: Fang, Luyang, et al.
Published: (2025)
AD-GPT: Large Language Models in Alzheimer's Disease
by: Liu, Ziyu, et al.
Published: (2025)
by: Liu, Ziyu, et al.
Published: (2025)
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
by: Zidan, Arif Hassan, et al.
Published: (2026)
by: Zidan, Arif Hassan, et al.
Published: (2026)
Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement
by: Shi, Xiang, et al.
Published: (2025)
by: Shi, Xiang, et al.
Published: (2025)
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
by: Zhang, Chenyu, et al.
Published: (2025)
by: Zhang, Chenyu, et al.
Published: (2025)
A recent evaluation on the performance of LLMs on radiation oncology physics using questions of randomly shuffled options
by: Wang, Peilong, et al.
Published: (2024)
by: Wang, Peilong, et al.
Published: (2024)
Understanding Model Ensemble in Transferable Adversarial Attack
by: Yao, Wei, et al.
Published: (2024)
by: Yao, Wei, et al.
Published: (2024)
Fabrication of Bioconjugates Clacked Chitosan‐Coated SN‐38 Liposomal Nanoparticles: Improved Precise Chemotherapy Efficacy in Lung Cancer Cells and Its Apoptosis
by: Xiaojun Zhang, et al.
Published: (2025)
by: Xiaojun Zhang, et al.
Published: (2025)
SAMAug: Point Prompt Augmentation for Segment Anything Model
by: Dai, Haixing, et al.
Published: (2023)
by: Dai, Haixing, et al.
Published: (2023)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
by: Liu, Pangpang, et al.
Published: (2025)
by: Liu, Pangpang, et al.
Published: (2025)
Network Analysis of Burnout and Safety Competence Among Oncology Nurses: A Secondary Study to Identify Bridge Targets for Precision Interventions
by: Fengyan Ma, et al.
Published: (2026)
by: Fengyan Ma, et al.
Published: (2026)
From Evaluation to Defense: Advancing Safety in Video Large Language Models
by: Sun, Yiwei, et al.
Published: (2025)
by: Sun, Yiwei, et al.
Published: (2025)
Towards Next-Generation Medical Agent: How o1 is Reshaping Decision-Making in Medical Scenarios
by: Xu, Shaochen, et al.
Published: (2024)
by: Xu, Shaochen, et al.
Published: (2024)
Determining the Minimum Number of Examined Lymph Nodes for N1b Papillary Thyroid Cancer Patients
by: Liu Xiao, et al.
Published: (2025)
by: Liu Xiao, et al.
Published: (2025)
DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Internalizing Safety Understanding in Large Reasoning Models via Verification
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
The Radiation Oncology NLP Database
by: Liu, Zhengliang, et al.
Published: (2024)
by: Liu, Zhengliang, et al.
Published: (2024)
Rare gelastic seizure associated with ATP6V0A2 gene variants in a patient with ARCLII
by: Xuan Zhang, et al.
Published: (2024)
by: Xuan Zhang, et al.
Published: (2024)
Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
by: Xie, Yuanbo, et al.
Published: (2025)
by: Xie, Yuanbo, et al.
Published: (2025)
Contingency Planning for Safety-Critical Autonomous Vehicles: A Review and Perspectives
by: Zheng, Lei, et al.
Published: (2026)
by: Zheng, Lei, et al.
Published: (2026)
Agent4POI: Agentic Context-Conditioned Affordance Reasoning for Multimodal Point-of-Interest Recommendation
by: Wang, Jinze, et al.
Published: (2026)
by: Wang, Jinze, et al.
Published: (2026)
Aligning Explanations for Recommendation with Rating and Feature via Maximizing Mutual Information
by: Zhao, Yurou, et al.
Published: (2024)
by: Zhao, Yurou, et al.
Published: (2024)
SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond
by: Zhu, Xiangyang, et al.
Published: (2026)
by: Zhu, Xiangyang, et al.
Published: (2026)
World Models: The Safety Perspective
by: Zeng, Zifan, et al.
Published: (2024)
by: Zeng, Zifan, et al.
Published: (2024)
Causal Learning for Heterogeneous Subgroups Based on Nonlinear Causal Kernel Clustering
by: Liu, Lu, et al.
Published: (2025)
by: Liu, Lu, et al.
Published: (2025)
Why Instruction-Based Unlearning Fails in Diffusion Models?
by: Zhang, Zeliang, et al.
Published: (2026)
by: Zhang, Zeliang, et al.
Published: (2026)
Safety and Efficacy of Aveir Leadless Pacemaker in Chinese Patients
by: Wuyang Zheng, et al.
Published: (2026)
by: Wuyang Zheng, et al.
Published: (2026)
Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety
by: Zhang, Max, et al.
Published: (2025)
by: Zhang, Max, et al.
Published: (2025)
Applications of Large Language Models in Radiation Oncology: From Workflow Automation to Clinical Intelligence
by: Ding, Yuzhen, et al.
Published: (2026)
by: Ding, Yuzhen, et al.
Published: (2026)
Secure LLM Fine-Tuning via Safety-Aware Probing
by: Wu, Chengcan, et al.
Published: (2025)
by: Wu, Chengcan, et al.
Published: (2025)
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
by: Wei, Zeming, et al.
Published: (2026)
by: Wei, Zeming, et al.
Published: (2026)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
by: Zhu, Xiangyang, et al.
Published: (2025)
by: Zhu, Xiangyang, et al.
Published: (2025)
Evaluation of Safety and Probiotic Properties of Weissella spp. in Fermented Vegetables From Xi'an, Shaanxi, China
by: Chen Liu, et al.
Published: (2024)
by: Chen Liu, et al.
Published: (2024)
Similar Items
-
Evaluating Mathematical Reasoning Across Large Language Models: A Fine-Grained Approach
by: Jahin, Afrar, et al.
Published: (2025) -
HOME-3: High-Order Momentum Estimator with Third-Power Gradient for Convex and Smooth Nonconvex Optimization
by: Zhang, Wei, et al.
Published: (2025) -
Permutation Randomization on Nonsmooth Nonconvex Optimization: A Theoretical and Experimental Study
by: Zhang, Wei, et al.
Published: (2025) -
Quantum-Classical Hybrid Molecular Autoencoder for Advancing Classical Decoding
by: Jahin, Afrar, et al.
Published: (2025) -
GP-GPT: Large Language Model for Gene-Phenotype Mapping
by: Lyu, Yanjun, et al.
Published: (2024)