Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
Fuente:
arXiv
Salvato in:
| Autori principali: | Doshi, Jai, Stickland, Asa Cooper |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Does Machine Unlearning Truly Remove Knowledge?
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
LUME: LLM Unlearning with Multitask Evaluations
di: Ramakrishna, Anil, et al.
Pubblicazione: (2025)
di: Ramakrishna, Anil, et al.
Pubblicazione: (2025)
LLM Unlearning with LLM Beliefs
di: Li, Kemou, et al.
Pubblicazione: (2025)
di: Li, Kemou, et al.
Pubblicazione: (2025)
Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
Robust LLM Unlearning with MUDMAN: Meta-Unlearning with Disruption Masking And Normalization
di: Sondej, Filip, et al.
Pubblicazione: (2025)
di: Sondej, Filip, et al.
Pubblicazione: (2025)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
di: Guo, Phillip, et al.
Pubblicazione: (2024)
di: Guo, Phillip, et al.
Pubblicazione: (2024)
LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
di: Fan, Chongyu, et al.
Pubblicazione: (2025)
di: Fan, Chongyu, et al.
Pubblicazione: (2025)
Explainable LLM Unlearning Through Reasoning
di: Liao, Junfeng, et al.
Pubblicazione: (2026)
di: Liao, Junfeng, et al.
Pubblicazione: (2026)
LLM Unlearning Should Be Form-Independent
di: Ye, Xiaotian, et al.
Pubblicazione: (2025)
di: Ye, Xiaotian, et al.
Pubblicazione: (2025)
Label Smoothing Improves Gradient Ascent in LLM Unlearning
di: Pang, Zirui, et al.
Pubblicazione: (2025)
di: Pang, Zirui, et al.
Pubblicazione: (2025)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
di: Chen, Hang, et al.
Pubblicazione: (2025)
di: Chen, Hang, et al.
Pubblicazione: (2025)
Leverage Unlearning to Sanitize LLMs
di: Boutet, Antoine, et al.
Pubblicazione: (2025)
di: Boutet, Antoine, et al.
Pubblicazione: (2025)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Textual Unlearning Gives a False Sense of Unlearning
di: Du, Jiacheng, et al.
Pubblicazione: (2024)
di: Du, Jiacheng, et al.
Pubblicazione: (2024)
LLM Unlearning Without an Expert Curated Dataset
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoyuan, et al.
Pubblicazione: (2025)
Geometric-disentangelment Unlearning
di: Zhou, Duo, et al.
Pubblicazione: (2025)
di: Zhou, Duo, et al.
Pubblicazione: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
di: Kadhe, Swanand Ravindra, et al.
Pubblicazione: (2024)
di: Kadhe, Swanand Ravindra, et al.
Pubblicazione: (2024)
How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective
di: Qiu, Xinchi, et al.
Pubblicazione: (2024)
di: Qiu, Xinchi, et al.
Pubblicazione: (2024)
SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
di: Jia, Jinghan, et al.
Pubblicazione: (2024)
di: Jia, Jinghan, et al.
Pubblicazione: (2024)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
di: Shang, Bingqi, et al.
Pubblicazione: (2025)
di: Shang, Bingqi, et al.
Pubblicazione: (2025)
Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts
di: Gao, Hongcheng, et al.
Pubblicazione: (2024)
di: Gao, Hongcheng, et al.
Pubblicazione: (2024)
TOFU: A Task of Fictitious Unlearning for LLMs
di: Maini, Pratyush, et al.
Pubblicazione: (2024)
di: Maini, Pratyush, et al.
Pubblicazione: (2024)
Measuring the Depth of LLM Unlearning via Activation Patching
di: Lee, Jaeung, et al.
Pubblicazione: (2026)
di: Lee, Jaeung, et al.
Pubblicazione: (2026)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
di: Shumailov, Ilia, et al.
Pubblicazione: (2024)
di: Shumailov, Ilia, et al.
Pubblicazione: (2024)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Rethinking Machine Unlearning for Large Language Models
di: Liu, Sijia, et al.
Pubblicazione: (2024)
di: Liu, Sijia, et al.
Pubblicazione: (2024)
Learn and Unlearn: Addressing Misinformation in Multilingual LLMs
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
Learning-Time Encoding Shapes Unlearning in LLMs
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
di: Wu, Ruihan, et al.
Pubblicazione: (2025)
Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs
di: Farashah, Alireza Dehghanpour, et al.
Pubblicazione: (2026)
di: Farashah, Alireza Dehghanpour, et al.
Pubblicazione: (2026)
Effective Skill Unlearning through Intervention and Abstention
di: Li, Yongce, et al.
Pubblicazione: (2025)
di: Li, Yongce, et al.
Pubblicazione: (2025)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
di: Price, Sara, et al.
Pubblicazione: (2024)
di: Price, Sara, et al.
Pubblicazione: (2024)
Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning
di: Liu, Yezi, et al.
Pubblicazione: (2025)
di: Liu, Yezi, et al.
Pubblicazione: (2025)
CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge
di: Bae, Seyun, et al.
Pubblicazione: (2026)
di: Bae, Seyun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Does Machine Unlearning Truly Remove Knowledge?
di: Chen, Haokun, et al.
Pubblicazione: (2025) -
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
di: Spohn, Philipp, et al.
Pubblicazione: (2025) -
LUME: LLM Unlearning with Multitask Evaluations
di: Ramakrishna, Anil, et al.
Pubblicazione: (2025) -
LLM Unlearning with LLM Beliefs
di: Li, Kemou, et al.
Pubblicazione: (2025) -
Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
di: Zhang, Xiang, et al.
Pubblicazione: (2025)