SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xiangman, Wu, Xiaodong, Li, Qi, Ni, Jianbing, Lu, Rongxing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SecureT2I: No More Unauthorized Manipulation on AI Generated Images from Prompts
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
Robustness of Watermarking on Text-to-Image Diffusion Models
von: Wu, Xiaodong, et al.
Veröffentlicht: (2024)
von: Wu, Xiaodong, et al.
Veröffentlicht: (2024)
PDLRecover: Privacy-preserving Decentralized Model Recovery with Machine Unlearning
von: Li, Xiangman, et al.
Veröffentlicht: (2025)
von: Li, Xiangman, et al.
Veröffentlicht: (2025)
Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing
von: Wu, Xiaodong, et al.
Veröffentlicht: (2026)
von: Wu, Xiaodong, et al.
Veröffentlicht: (2026)
Jailbreaking Attack against Multimodal Large Language Model
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
von: Robey, Alexander, et al.
Veröffentlicht: (2023)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
von: Li, Xiao, et al.
Veröffentlicht: (2024)
von: Li, Xiao, et al.
Veröffentlicht: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
von: Zeng, Yifan, et al.
Veröffentlicht: (2024)
SPIRIT: Patching Speech Language Models against Jailbreak Attacks
von: Djanibekov, Amirbek, et al.
Veröffentlicht: (2025)
von: Djanibekov, Amirbek, et al.
Veröffentlicht: (2025)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
When There Is No Decoder: Removing Watermarks from Stable Diffusion Models in a No-box Setting
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025)
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
von: Zhang, Xianren, et al.
Veröffentlicht: (2025)
von: Zhang, Xianren, et al.
Veröffentlicht: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
von: Liu, Guozhi, et al.
Veröffentlicht: (2024)
von: Liu, Guozhi, et al.
Veröffentlicht: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs
von: Chen, Yiwei, et al.
Veröffentlicht: (2025)
von: Chen, Yiwei, et al.
Veröffentlicht: (2025)
Editing as Unlearning: Are Knowledge Editing Methods Strong Baselines for Large Language Model Unlearning?
von: Li, Zexi, et al.
Veröffentlicht: (2025)
von: Li, Zexi, et al.
Veröffentlicht: (2025)
The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models
von: Yang, Xikang, et al.
Veröffentlicht: (2024)
von: Yang, Xikang, et al.
Veröffentlicht: (2024)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
von: Hu, Zixuan, et al.
Veröffentlicht: (2025)
von: Hu, Zixuan, et al.
Veröffentlicht: (2025)
On Large Language Model Continual Unlearning
von: Gao, Chongyang, et al.
Veröffentlicht: (2024)
von: Gao, Chongyang, et al.
Veröffentlicht: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
Semantic Membership Inference Attack against Large Language Models
von: Mozaffari, Hamid, et al.
Veröffentlicht: (2024)
von: Mozaffari, Hamid, et al.
Veröffentlicht: (2024)
Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning
von: Wei, Rongzhe, et al.
Veröffentlicht: (2024)
von: Wei, Rongzhe, et al.
Veröffentlicht: (2024)
Protecting the Neural Networks against FGSM Attack Using Machine Unlearning
von: Khorasani, Amir Hossein, et al.
Veröffentlicht: (2025)
von: Khorasani, Amir Hossein, et al.
Veröffentlicht: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
von: Chen, Taiye, et al.
Veröffentlicht: (2025)
von: Chen, Taiye, et al.
Veröffentlicht: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
von: Tran, Toan, et al.
Veröffentlicht: (2025)
von: Tran, Toan, et al.
Veröffentlicht: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
TurboFuzzLLM: Turbocharging Mutation-based Fuzzing for Effectively Jailbreaking Large Language Models in Practice
von: Goel, Aman, et al.
Veröffentlicht: (2025)
von: Goel, Aman, et al.
Veröffentlicht: (2025)
Per-parameter Task Arithmetic for Unlearning in Large Language Models
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
von: Li, Xuan, et al.
Veröffentlicht: (2023)
von: Li, Xuan, et al.
Veröffentlicht: (2023)
AlignTree: Efficient Defense Against LLM Jailbreak Attacks
von: Goren, Gil, et al.
Veröffentlicht: (2025)
von: Goren, Gil, et al.
Veröffentlicht: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
von: Wei, Zhipeng, et al.
Veröffentlicht: (2024)
von: Wei, Zhipeng, et al.
Veröffentlicht: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
von: Yang, Fan
Veröffentlicht: (2025)
von: Yang, Fan
Veröffentlicht: (2025)
Ähnliche Einträge
-
SecureT2I: No More Unauthorized Manipulation on AI Generated Images from Prompts
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025) -
SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models
von: Wu, Xiaodong, et al.
Veröffentlicht: (2025) -
Robustness of Watermarking on Text-to-Image Diffusion Models
von: Wu, Xiaodong, et al.
Veröffentlicht: (2024) -
PDLRecover: Privacy-preserving Decentralized Model Recovery with Machine Unlearning
von: Li, Xiangman, et al.
Veröffentlicht: (2025) -
Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing
von: Wu, Xiaodong, et al.
Veröffentlicht: (2026)