An Adversarial Perspective on Machine Unlearning for AI Safety
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Łucki, Jakub, Wei, Boyi, Huang, Yangsibo, Henderson, Peter, Tramèr, Florian, Rando, Javier |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Universal Jailbreak Backdoors from Poisoned Human Feedback
par: Rando, Javier, et autres
Publié: (2023)
par: Rando, Javier, et autres
Publié: (2023)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
par: Rando, Javier, et autres
Publié: (2024)
par: Rando, Javier, et autres
Publié: (2024)
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
par: Carlini, Nicholas, et autres
Publié: (2025)
par: Carlini, Nicholas, et autres
Publié: (2025)
Query-Based Adversarial Prompt Generation
par: Hayase, Jonathan, et autres
Publié: (2024)
par: Hayase, Jonathan, et autres
Publié: (2024)
Adversarial ML Problems Are Getting Harder to Solve and to Evaluate
par: Rando, Javier, et autres
Publié: (2025)
par: Rando, Javier, et autres
Publié: (2025)
What is in Your Safe Data? Identifying Benign Data that Breaks Safety
par: He, Luxi, et autres
Publié: (2024)
par: He, Luxi, et autres
Publié: (2024)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
par: Shumailov, Ilia, et autres
Publié: (2024)
par: Shumailov, Ilia, et autres
Publié: (2024)
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Machine Unlearning with Minimal Gradient Dependence for High Unlearning Ratios
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
Certifying LLM Safety against Adversarial Prompting
par: Kumar, Aounon, et autres
Publié: (2023)
par: Kumar, Aounon, et autres
Publié: (2023)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
par: Nikolić, Kristina, et autres
Publié: (2025)
par: Nikolić, Kristina, et autres
Publié: (2025)
Textual Unlearning Gives a False Sense of Unlearning
par: Du, Jiacheng, et autres
Publié: (2024)
par: Du, Jiacheng, et autres
Publié: (2024)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
par: Wu, Xiaoyu, et autres
Publié: (2025)
par: Wu, Xiaoyu, et autres
Publié: (2025)
Gradient-based Jailbreak Images for Multimodal Fusion Models
par: Rando, Javier, et autres
Publié: (2024)
par: Rando, Javier, et autres
Publié: (2024)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
par: To, Bang Trinh Tran, et autres
Publié: (2025)
par: To, Bang Trinh Tran, et autres
Publié: (2025)
Are aligned neural networks adversarially aligned?
par: Carlini, Nicholas, et autres
Publié: (2023)
par: Carlini, Nicholas, et autres
Publié: (2023)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Laundering AI Authority with Adversarial Examples
par: Zhang, Jie, et autres
Publié: (2026)
par: Zhang, Jie, et autres
Publié: (2026)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
par: Liu, Zesen, et autres
Publié: (2024)
par: Liu, Zesen, et autres
Publié: (2024)
Intent Laundering: AI Safety Datasets Are Not What They Seem
par: Golchin, Shahriar, et autres
Publié: (2026)
par: Golchin, Shahriar, et autres
Publié: (2026)
Trustworthy AI: Safety, Bias, and Privacy -- A Survey
par: Fang, Xingli, et autres
Publié: (2025)
par: Fang, Xingli, et autres
Publié: (2025)
Large-scale online deanonymization with LLMs
par: Lermen, Simon, et autres
Publié: (2026)
par: Lermen, Simon, et autres
Publié: (2026)
Adversarial Perturbations Cannot Reliably Protect Artists From Generative AI
par: Hönig, Robert, et autres
Publié: (2024)
par: Hönig, Robert, et autres
Publié: (2024)
LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning
par: Spracklen, Joseph, et autres
Publié: (2026)
par: Spracklen, Joseph, et autres
Publié: (2026)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
par: Mo, Yichuan, et autres
Publié: (2024)
par: Mo, Yichuan, et autres
Publié: (2024)
Blind Baselines Beat Membership Inference Attacks for Foundation Models
par: Das, Debeshee, et autres
Publié: (2024)
par: Das, Debeshee, et autres
Publié: (2024)
Challenges in Ensuring AI Safety in DeepSeek-R1 Models: The Shortcomings of Reinforcement Learning Strategies
par: Parmar, Manojkumar, et autres
Publié: (2025)
par: Parmar, Manojkumar, et autres
Publié: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
par: Chen, Taiye, et autres
Publié: (2025)
par: Chen, Taiye, et autres
Publié: (2025)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
par: Li, Jianwei, et autres
Publié: (2025)
par: Li, Jianwei, et autres
Publié: (2025)
Adversarial Search Engine Optimization for Large Language Models
par: Nestaas, Fredrik, et autres
Publié: (2024)
par: Nestaas, Fredrik, et autres
Publié: (2024)
On the Role of Attention Heads in Large Language Model Safety
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
par: Gu, Tianle, et autres
Publié: (2025)
par: Gu, Tianle, et autres
Publié: (2025)
FRAMU: Attention-based Machine Unlearning using Federated Reinforcement Learning
par: Shaik, Thanveer, et autres
Publié: (2023)
par: Shaik, Thanveer, et autres
Publié: (2023)
Breaking the Trilemma of Privacy, Utility, Efficiency via Controllable Machine Unlearning
par: Liu, Zheyuan, et autres
Publié: (2023)
par: Liu, Zheyuan, et autres
Publié: (2023)
SALAD: Systematic Assessment of Machine Unlearning on LLM-Aided Hardware Design
par: Wang, Zeng, et autres
Publié: (2025)
par: Wang, Zeng, et autres
Publié: (2025)
Documents similaires
-
Universal Jailbreak Backdoors from Poisoned Human Feedback
par: Rando, Javier, et autres
Publié: (2023) -
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
par: Rando, Javier, et autres
Publié: (2024) -
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
par: Carlini, Nicholas, et autres
Publié: (2025) -
Query-Based Adversarial Prompt Generation
par: Hayase, Jonathan, et autres
Publié: (2024) -
Adversarial ML Problems Are Getting Harder to Solve and to Evaluate
par: Rando, Javier, et autres
Publié: (2025)