Precision Knowledge Editing: Enhancing Safety in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xuying, Li, Zhuo, Kosuga, Yuji, Yoshida, Yasuhiro, Bian, Victor |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
by: Li, Xuying, et al.
Published: (2025)
by: Li, Xuying, et al.
Published: (2025)
Targeting the Core: A Simple and Effective Method to Attack RAG-based Agents via Direct LLM Manipulation
by: Li, Xuying, et al.
Published: (2024)
by: Li, Xuying, et al.
Published: (2024)
Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
by: Li, Xuying, et al.
Published: (2025)
by: Li, Xuying, et al.
Published: (2025)
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
by: Shu, Huizhen, et al.
Published: (2025)
by: Shu, Huizhen, et al.
Published: (2025)
Identifying Knowledge Editing Types in Large Language Models
by: Li, Xiaopeng, et al.
Published: (2024)
by: Li, Xiaopeng, et al.
Published: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
by: Tan, Yuting, et al.
Published: (2025)
by: Tan, Yuting, et al.
Published: (2025)
Knowledge Editing for Large Language Models: A Survey
by: Wang, Song, et al.
Published: (2023)
by: Wang, Song, et al.
Published: (2023)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
by: Chen, Ruizhe, et al.
Published: (2024)
by: Chen, Ruizhe, et al.
Published: (2024)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
by: Gu, Leijiang, et al.
Published: (2026)
by: Gu, Leijiang, et al.
Published: (2026)
Cross-Lingual Knowledge Editing in Large Language Models
by: Wang, Jiaan, et al.
Published: (2023)
by: Wang, Jiaan, et al.
Published: (2023)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
by: Xu, Derong, et al.
Published: (2024)
by: Xu, Derong, et al.
Published: (2024)
$μ$KE: Matryoshka Unstructured Knowledge Editing of Large Language Models
by: Su, Zian, et al.
Published: (2025)
by: Su, Zian, et al.
Published: (2025)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
by: Li, Xin, et al.
Published: (2025)
by: Li, Xin, et al.
Published: (2025)
On the Superimposed Noise Accumulation Problem in Sequential Knowledge Editing of Large Language Models
by: Cao, Ding, et al.
Published: (2025)
by: Cao, Ding, et al.
Published: (2025)
STEAM: A Semantic-Level Knowledge Editing Framework for Large Language Models
by: Jeong, Geunyeong, et al.
Published: (2025)
by: Jeong, Geunyeong, et al.
Published: (2025)
The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models
by: Wang, Zheng, et al.
Published: (2026)
by: Wang, Zheng, et al.
Published: (2026)
Knowledge Editing on Black-box Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
Knowledge Graph-Enhanced Large Language Models via Path Selection
by: Liu, Haochen, et al.
Published: (2024)
by: Liu, Haochen, et al.
Published: (2024)
Ontology-Enhanced Knowledge Graph Completion using Large Language Models
by: Guo, Wenbin, et al.
Published: (2025)
by: Guo, Wenbin, et al.
Published: (2025)
Context-Robust Knowledge Editing for Language Models
by: Park, Haewon, et al.
Published: (2025)
by: Park, Haewon, et al.
Published: (2025)
Large Language Model Enhanced Knowledge Representation Learning: A Survey
by: Wang, Xin, et al.
Published: (2024)
by: Wang, Xin, et al.
Published: (2024)
Give Us the Facts: Enhancing Large Language Models with Knowledge Graphs for Fact-aware Language Modeling
by: Yang, Linyao, et al.
Published: (2023)
by: Yang, Linyao, et al.
Published: (2023)
Consistency-Aware Editing for Entity-level Unlearning in Language Models
by: Han, Xiaoqi, et al.
Published: (2025)
by: Han, Xiaoqi, et al.
Published: (2025)
Evaluating Psychological Safety of Large Language Models
by: Li, Xingxuan, et al.
Published: (2022)
by: Li, Xingxuan, et al.
Published: (2022)
MEGen: Generative Backdoor into Large Language Models via Model Editing
by: Qiu, Jiyang, et al.
Published: (2024)
by: Qiu, Jiyang, et al.
Published: (2024)
Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models
by: Gu, Xiaojie, et al.
Published: (2026)
by: Gu, Xiaojie, et al.
Published: (2026)
PMET: Precise Model Editing in a Transformer
by: Li, Xiaopeng, et al.
Published: (2023)
by: Li, Xiaopeng, et al.
Published: (2023)
Unveiling the Pitfalls of Knowledge Editing for Large Language Models
by: Li, Zhoubo, et al.
Published: (2023)
by: Li, Zhoubo, et al.
Published: (2023)
Enhancing Data Privacy in Large Language Models through Private Association Editing
by: Venditti, Davide, et al.
Published: (2024)
by: Venditti, Davide, et al.
Published: (2024)
Safety-Aware Fine-Tuning of Large Language Models
by: Choi, Hyeong Kyu, et al.
Published: (2024)
by: Choi, Hyeong Kyu, et al.
Published: (2024)
Channel-Wise Mixed-Precision Quantization for Large Language Models
by: Chen, Zihan, et al.
Published: (2024)
by: Chen, Zihan, et al.
Published: (2024)
StruEdit: Structured Outputs Enable the Fast and Accurate Knowledge Editing for Large Language Models
by: Bi, Baolong, et al.
Published: (2024)
by: Bi, Baolong, et al.
Published: (2024)
Agentic Reasoning for Large Language Models
by: Wei, Tianxin, et al.
Published: (2026)
by: Wei, Tianxin, et al.
Published: (2026)
K-ON: Stacking Knowledge On the Head Layer of Large Language Model
by: Guo, Lingbing, et al.
Published: (2025)
by: Guo, Lingbing, et al.
Published: (2025)
LawGPT: A Chinese Legal Knowledge-Enhanced Large Language Model
by: Zhou, Zhi, et al.
Published: (2024)
by: Zhou, Zhi, et al.
Published: (2024)
Event-level Knowledge Editing
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
by: Veldanda, Akshaj Kumar, et al.
Published: (2024)
by: Veldanda, Akshaj Kumar, et al.
Published: (2024)
Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
by: Zhang, Rongzhi, et al.
Published: (2025)
by: Zhang, Rongzhi, et al.
Published: (2025)
Enhancing Safety of Large Language Models via Embedding Space Separation
by: Zhao, Xu, et al.
Published: (2026)
by: Zhao, Xu, et al.
Published: (2026)
Knowledge Fusion of Large Language Models Via Modular SkillPacks
by: Du, Guodong, et al.
Published: (2025)
by: Du, Guodong, et al.
Published: (2025)
Similar Items
-
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
by: Li, Xuying, et al.
Published: (2025) -
Targeting the Core: A Simple and Effective Method to Attack RAG-based Agents via Direct LLM Manipulation
by: Li, Xuying, et al.
Published: (2024) -
Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach
by: Li, Xuying, et al.
Published: (2025) -
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
by: Shu, Huizhen, et al.
Published: (2025) -
Identifying Knowledge Editing Types in Large Language Models
by: Li, Xiaopeng, et al.
Published: (2024)