Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
Fuente:
arXiv
Guardado en:
| Autores principales: | Doshi, Jai, Stickland, Asa Cooper |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Does Machine Unlearning Truly Remove Knowledge?
por: Chen, Haokun, et al.
Publicado: (2025)
por: Chen, Haokun, et al.
Publicado: (2025)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
por: Spohn, Philipp, et al.
Publicado: (2025)
por: Spohn, Philipp, et al.
Publicado: (2025)
LUME: LLM Unlearning with Multitask Evaluations
por: Ramakrishna, Anil, et al.
Publicado: (2025)
por: Ramakrishna, Anil, et al.
Publicado: (2025)
LLM Unlearning with LLM Beliefs
por: Li, Kemou, et al.
Publicado: (2025)
por: Li, Kemou, et al.
Publicado: (2025)
Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
por: Zhang, Xiang, et al.
Publicado: (2025)
por: Zhang, Xiang, et al.
Publicado: (2025)
Robust LLM Unlearning with MUDMAN: Meta-Unlearning with Disruption Masking And Normalization
por: Sondej, Filip, et al.
Publicado: (2025)
por: Sondej, Filip, et al.
Publicado: (2025)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
por: Wu, Xiaoyu, et al.
Publicado: (2025)
por: Wu, Xiaoyu, et al.
Publicado: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
por: Guo, Phillip, et al.
Publicado: (2024)
por: Guo, Phillip, et al.
Publicado: (2024)
LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
por: Fan, Chongyu, et al.
Publicado: (2025)
por: Fan, Chongyu, et al.
Publicado: (2025)
Explainable LLM Unlearning Through Reasoning
por: Liao, Junfeng, et al.
Publicado: (2026)
por: Liao, Junfeng, et al.
Publicado: (2026)
LLM Unlearning Should Be Form-Independent
por: Ye, Xiaotian, et al.
Publicado: (2025)
por: Ye, Xiaotian, et al.
Publicado: (2025)
Label Smoothing Improves Gradient Ascent in LLM Unlearning
por: Pang, Zirui, et al.
Publicado: (2025)
por: Pang, Zirui, et al.
Publicado: (2025)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
Leverage Unlearning to Sanitize LLMs
por: Boutet, Antoine, et al.
Publicado: (2025)
por: Boutet, Antoine, et al.
Publicado: (2025)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
por: Tang, Haoyu, et al.
Publicado: (2024)
por: Tang, Haoyu, et al.
Publicado: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
por: Lin, Yujie, et al.
Publicado: (2026)
por: Lin, Yujie, et al.
Publicado: (2026)
Textual Unlearning Gives a False Sense of Unlearning
por: Du, Jiacheng, et al.
Publicado: (2024)
por: Du, Jiacheng, et al.
Publicado: (2024)
LLM Unlearning Without an Expert Curated Dataset
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
Geometric-disentangelment Unlearning
por: Zhou, Duo, et al.
Publicado: (2025)
por: Zhou, Duo, et al.
Publicado: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
por: Kadhe, Swanand Ravindra, et al.
Publicado: (2024)
por: Kadhe, Swanand Ravindra, et al.
Publicado: (2024)
How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective
por: Qiu, Xinchi, et al.
Publicado: (2024)
por: Qiu, Xinchi, et al.
Publicado: (2024)
SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
por: Jia, Jinghan, et al.
Publicado: (2024)
por: Jia, Jinghan, et al.
Publicado: (2024)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
por: Xu, Xiaoyu, et al.
Publicado: (2025)
por: Xu, Xiaoyu, et al.
Publicado: (2025)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
por: Ren, Jie, et al.
Publicado: (2025)
por: Ren, Jie, et al.
Publicado: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
por: Shang, Bingqi, et al.
Publicado: (2025)
por: Shang, Bingqi, et al.
Publicado: (2025)
Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts
por: Gao, Hongcheng, et al.
Publicado: (2024)
por: Gao, Hongcheng, et al.
Publicado: (2024)
TOFU: A Task of Fictitious Unlearning for LLMs
por: Maini, Pratyush, et al.
Publicado: (2024)
por: Maini, Pratyush, et al.
Publicado: (2024)
Measuring the Depth of LLM Unlearning via Activation Patching
por: Lee, Jaeung, et al.
Publicado: (2026)
por: Lee, Jaeung, et al.
Publicado: (2026)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
por: Shumailov, Ilia, et al.
Publicado: (2024)
por: Shumailov, Ilia, et al.
Publicado: (2024)
Large Language Model Unlearning
por: Yao, Yuanshun, et al.
Publicado: (2023)
por: Yao, Yuanshun, et al.
Publicado: (2023)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
por: Feng, Xiaohua, et al.
Publicado: (2025)
por: Feng, Xiaohua, et al.
Publicado: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
por: Feng, Zhili, et al.
Publicado: (2025)
por: Feng, Zhili, et al.
Publicado: (2025)
Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs
por: Price, Sara, et al.
Publicado: (2024)
por: Price, Sara, et al.
Publicado: (2024)
Rethinking Machine Unlearning for Large Language Models
por: Liu, Sijia, et al.
Publicado: (2024)
por: Liu, Sijia, et al.
Publicado: (2024)
Learn and Unlearn: Addressing Misinformation in Multilingual LLMs
por: Lu, Taiming, et al.
Publicado: (2024)
por: Lu, Taiming, et al.
Publicado: (2024)
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)
por: Wu, Ruihan, et al.
Publicado: (2025)
Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs
por: Farashah, Alireza Dehghanpour, et al.
Publicado: (2026)
por: Farashah, Alireza Dehghanpour, et al.
Publicado: (2026)
Effective Skill Unlearning through Intervention and Abstention
por: Li, Yongce, et al.
Publicado: (2025)
por: Li, Yongce, et al.
Publicado: (2025)
Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning
por: Liu, Yezi, et al.
Publicado: (2025)
por: Liu, Yezi, et al.
Publicado: (2025)
CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge
por: Bae, Seyun, et al.
Publicado: (2026)
por: Bae, Seyun, et al.
Publicado: (2026)
Ejemplares similares
-
Does Machine Unlearning Truly Remove Knowledge?
por: Chen, Haokun, et al.
Publicado: (2025) -
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
por: Spohn, Philipp, et al.
Publicado: (2025) -
LUME: LLM Unlearning with Multitask Evaluations
por: Ramakrishna, Anil, et al.
Publicado: (2025) -
LLM Unlearning with LLM Beliefs
por: Li, Kemou, et al.
Publicado: (2025) -
Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
por: Zhang, Xiang, et al.
Publicado: (2025)