Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Weikai, Zeng, Ziqian, Wang, Jianwei, Lu, Zhengdong, Chen, Zelin, Zhuang, Huiping, Chen, Cen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
Decompose, Plan in Parallel, and Merge: A Novel Paradigm for Large Language Models based Planning with Multiple Constraints
von: Lu, Zhengdong, et al.
Veröffentlicht: (2025)
von: Lu, Zhengdong, et al.
Veröffentlicht: (2025)
RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
von: Yang, Junyao, et al.
Veröffentlicht: (2025)
von: Yang, Junyao, et al.
Veröffentlicht: (2025)
PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
von: Lu, Liming, et al.
Veröffentlicht: (2025)
von: Lu, Liming, et al.
Veröffentlicht: (2025)
SynAdapt: Learning Adaptive Reasoning in Large Language Models via Synthetic Continuous Chain-of-Thought
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models
von: Yang, Hao, et al.
Veröffentlicht: (2024)
von: Yang, Hao, et al.
Veröffentlicht: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
von: Yang, Guangyu, et al.
Veröffentlicht: (2025)
von: Yang, Guangyu, et al.
Veröffentlicht: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
von: Cheng, Zehua, et al.
Veröffentlicht: (2026)
von: Cheng, Zehua, et al.
Veröffentlicht: (2026)
Learning with Silver Standard Data for Zero-shot Relation Extraction
von: Wang, Tianyin, et al.
Veröffentlicht: (2022)
von: Wang, Tianyin, et al.
Veröffentlicht: (2022)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
von: Yi, Xin, et al.
Veröffentlicht: (2025)
von: Yi, Xin, et al.
Veröffentlicht: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
von: Wang, Jianwei, et al.
Veröffentlicht: (2025)
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
On the use of Silver Standard Data for Zero-shot Classification Tasks in Information Extraction
von: Wang, Jianwei, et al.
Veröffentlicht: (2024)
von: Wang, Jianwei, et al.
Veröffentlicht: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
Resolving Editing-Unlearning Conflicts: A Knowledge Codebook Framework for Large Language Model Updating
von: Zhang, Binchi, et al.
Veröffentlicht: (2025)
von: Zhang, Binchi, et al.
Veröffentlicht: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
von: Gu, Jia-Chen, et al.
Veröffentlicht: (2024)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
von: Tian, Bozhong, et al.
Veröffentlicht: (2024)
von: Tian, Bozhong, et al.
Veröffentlicht: (2024)
InfoFlood: Jailbreaking Large Language Models with Information Overload
von: Yadav, Advait, et al.
Veröffentlicht: (2025)
von: Yadav, Advait, et al.
Veröffentlicht: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
von: Zhang, Chiyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chiyu, et al.
Veröffentlicht: (2025)
LLM-Align: Utilizing Large Language Models for Entity Alignment in Knowledge Graphs
von: Chen, Xuan, et al.
Veröffentlicht: (2024)
von: Chen, Xuan, et al.
Veröffentlicht: (2024)
SDD: Self-Degraded Defense against Malicious Fine-tuning
von: Chen, Zixuan, et al.
Veröffentlicht: (2025)
von: Chen, Zixuan, et al.
Veröffentlicht: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
von: Wang, Zhenhua, et al.
Veröffentlicht: (2024)
von: Wang, Zhenhua, et al.
Veröffentlicht: (2024)
ID-Eraser: Proactive Defense Against Face Swapping via Identity Perturbation
von: Luo, Junyan, et al.
Veröffentlicht: (2026)
von: Luo, Junyan, et al.
Veröffentlicht: (2026)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
Learning and Unlearning of Fabricated Knowledge in Language Models
von: Sun, Chen, et al.
Veröffentlicht: (2024)
von: Sun, Chen, et al.
Veröffentlicht: (2024)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
von: Li, Yu, et al.
Veröffentlicht: (2026)
von: Li, Yu, et al.
Veröffentlicht: (2026)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
von: Yamashita, Tomoya, et al.
Veröffentlicht: (2025)
von: Yamashita, Tomoya, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
von: Lu, Weikai, et al.
Veröffentlicht: (2025) -
Decompose, Plan in Parallel, and Merge: A Novel Paradigm for Large Language Models based Planning with Multiple Constraints
von: Lu, Zhengdong, et al.
Veröffentlicht: (2025) -
RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
von: Yang, Junyao, et al.
Veröffentlicht: (2025) -
PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024) -
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023)