Large Language Model Safety: A Holistic Survey
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shi, Dan, Shen, Tianhao, Huang, Yufei, Li, Zhigen, Leng, Yongqi, Jin, Renren, Liu, Chuang, Wu, Xinwei, Guo, Zishan, Yu, Linhao, Shi, Ling, Jiang, Bojian, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
Exploring Multilingual Concepts of Human Value in Large Language Models: Is Value Alignment Consistent, Transferable and Controllable across Languages?
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons
von: Leng, Yongqi, et al.
Veröffentlicht: (2024)
von: Leng, Yongqi, et al.
Veröffentlicht: (2024)
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
von: Shi, Dan, et al.
Veröffentlicht: (2026)
von: Shi, Dan, et al.
Veröffentlicht: (2026)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Automated Progressive Red Teaming
von: Jiang, Bojian, et al.
Veröffentlicht: (2024)
von: Jiang, Bojian, et al.
Veröffentlicht: (2024)
TaP: A Taxonomy-Guided Framework for Automated and Scalable Preference Data Generation
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Multilingual Large Language Models: A Systematic Survey
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision
von: Leng, Yongqi, et al.
Veröffentlicht: (2025)
von: Leng, Yongqi, et al.
Veröffentlicht: (2025)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
von: Huang, Wuwei, et al.
Veröffentlicht: (2025)
DEP: A Decentralized Large Language Model Evaluation Protocol
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2026)
von: Shi, Ling, et al.
Veröffentlicht: (2026)
Blockchain for Large Language Model Security and Safety: A Holistic Survey
von: Geren, Caleb, et al.
Veröffentlicht: (2024)
von: Geren, Caleb, et al.
Veröffentlicht: (2024)
GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models
von: Wang, Leyan, et al.
Veröffentlicht: (2024)
von: Wang, Leyan, et al.
Veröffentlicht: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
von: Yu, Linhao, et al.
Veröffentlicht: (2026)
von: Yu, Linhao, et al.
Veröffentlicht: (2026)
Perturbation is All You Need for Extrapolating Language Models
von: Cen, Zetai, et al.
Veröffentlicht: (2026)
von: Cen, Zetai, et al.
Veröffentlicht: (2026)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
Interplay Between Single-Photon Ionization and the Auger Process in Argon Ion Formation
von: Xiong, Linhao
Veröffentlicht: (2024)
von: Xiong, Linhao
Veröffentlicht: (2024)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
von: Yu, Linhao, et al.
Veröffentlicht: (2025)
von: Yu, Linhao, et al.
Veröffentlicht: (2025)
Unifying Large Language Models and Knowledge Graphs: A Roadmap
von: Pan, Shirui, et al.
Veröffentlicht: (2023)
von: Pan, Shirui, et al.
Veröffentlicht: (2023)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
von: Shen, Guanxi
Veröffentlicht: (2025)
von: Shen, Guanxi
Veröffentlicht: (2025)
Ähnliche Einträge
-
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024) -
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
von: Shi, Dan, et al.
Veröffentlicht: (2024) -
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024) -
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024) -
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025)