Safety Alignment via Constrained Knowledge Unlearning
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Zesheng, Zhou, Yucheng, Li, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation
di: Han, Chengrui, et al.
Pubblicazione: (2026)
di: Han, Chengrui, et al.
Pubblicazione: (2026)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
di: Li, Wu, et al.
Pubblicazione: (2026)
di: Li, Wu, et al.
Pubblicazione: (2026)
SHA256 at SemEval-2025 Task 4: Selective Amnesia -- Constrained Unlearning for Large Language Models via Knowledge Isolation
di: Agrawal, Saransh, et al.
Pubblicazione: (2025)
di: Agrawal, Saransh, et al.
Pubblicazione: (2025)
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
di: In, Yeonjun, et al.
Pubblicazione: (2025)
di: In, Yeonjun, et al.
Pubblicazione: (2025)
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
di: Li, Junliang, et al.
Pubblicazione: (2025)
di: Li, Junliang, et al.
Pubblicazione: (2025)
Constrain Alignment with Sparse Autoencoders
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
Learning and Unlearning of Fabricated Knowledge in Language Models
di: Sun, Chen, et al.
Pubblicazione: (2024)
di: Sun, Chen, et al.
Pubblicazione: (2024)
Knowledge Fusion of Large Language Models Via Modular SkillPacks
di: Du, Guodong, et al.
Pubblicazione: (2025)
di: Du, Guodong, et al.
Pubblicazione: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
Intrinsic Test of Unlearning Using Parametric Knowledge Traces
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
Multilingual Safety Alignment via Self-Distillation
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
di: Qin, Ruiyang, et al.
Pubblicazione: (2026)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
di: Zhang, Zhibo, et al.
Pubblicazione: (2025)
di: Zhang, Zhibo, et al.
Pubblicazione: (2025)
Enhancing Large Language Model for Knowledge Graph Completion via Structure-Aware Alignment-Tuning
di: Liu, Yu, et al.
Pubblicazione: (2025)
di: Liu, Yu, et al.
Pubblicazione: (2025)
Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
di: Brito, Iago Alves, et al.
Pubblicazione: (2026)
Efficient Knowledge Infusion via KG-LLM Alignment
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
di: Jiang, Zhouyu, et al.
Pubblicazione: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
di: Wu, Di, et al.
Pubblicazione: (2026)
di: Wu, Di, et al.
Pubblicazione: (2026)
Cat-DPO: Category-Adaptive Safety Alignment
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Catastrophic Failure of LLM Unlearning via Quantization
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering
di: Shi, Yucheng, et al.
Pubblicazione: (2023)
di: Shi, Yucheng, et al.
Pubblicazione: (2023)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
di: Zhang, Jingyu, et al.
Pubblicazione: (2024)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
di: Veldanda, Akshaj Kumar, et al.
Pubblicazione: (2024)
di: Veldanda, Akshaj Kumar, et al.
Pubblicazione: (2024)
Psychometric Alignment: Capturing Human Knowledge Distributions via Language Models
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models
di: Fang, Junfeng, et al.
Pubblicazione: (2024)
di: Fang, Junfeng, et al.
Pubblicazione: (2024)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
di: Sun, Chenkai, et al.
Pubblicazione: (2025)
di: Sun, Chenkai, et al.
Pubblicazione: (2025)
Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Semantic Alignment
di: Sun, Yanru, et al.
Pubblicazione: (2025)
di: Sun, Yanru, et al.
Pubblicazione: (2025)
SafeWorld: Geo-Diverse Safety Alignment
di: Yin, Da, et al.
Pubblicazione: (2024)
di: Yin, Da, et al.
Pubblicazione: (2024)
Retrieval-enhanced Knowledge Editing in Language Models for Multi-Hop Question Answering
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
di: Shi, Yucheng, et al.
Pubblicazione: (2024)
Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
di: Alssum, Lama, et al.
Pubblicazione: (2025)
di: Alssum, Lama, et al.
Pubblicazione: (2025)
Two Heads Are Better Than One: Integrating Knowledge from Knowledge Graphs and Large Language Models for Entity Alignment
di: Yang, Linyao, et al.
Pubblicazione: (2024)
di: Yang, Linyao, et al.
Pubblicazione: (2024)
HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement Learning
di: Cui, Ziang, et al.
Pubblicazione: (2026)
di: Cui, Ziang, et al.
Pubblicazione: (2026)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
Does Machine Unlearning Truly Remove Knowledge?
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
di: Pan, Wenbo, et al.
Pubblicazione: (2025)
Precision Knowledge Editing: Enhancing Safety in Large Language Models
di: Li, Xuying, et al.
Pubblicazione: (2024)
di: Li, Xuying, et al.
Pubblicazione: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
MESA: Improving MoE Safety Alignment via Decentralized Expertise
di: Sun, Yitong, et al.
Pubblicazione: (2026)
di: Sun, Yitong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation
di: Han, Chengrui, et al.
Pubblicazione: (2026) -
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
di: Li, Wu, et al.
Pubblicazione: (2026) -
SHA256 at SemEval-2025 Task 4: Selective Amnesia -- Constrained Unlearning for Large Language Models via Knowledge Isolation
di: Agrawal, Saransh, et al.
Pubblicazione: (2025) -
R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
di: In, Yeonjun, et al.
Pubblicazione: (2025) -
Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
di: Li, Junliang, et al.
Pubblicazione: (2025)