Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Phillip, Syed, Aaquib, Sheshadri, Abhay, Ewart, Aidan, Dziugaite, Gintare Karolina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Data Selection for Transfer Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024)
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024)
Improved Localized Machine Unlearning Through the Lens of Memorization
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024)
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024)
Eight Methods to Evaluate Robust Unlearning in LLMs
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
Unlearning in- vs. out-of-distribution data in LLMs under gradient-based method
di: Baluta, Teodora, et al.
Pubblicazione: (2024)
di: Baluta, Teodora, et al.
Pubblicazione: (2024)
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)
From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2025)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2025)
Evaluating Interventional Reasoning Capabilities of Large Language Models
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
di: Kasetty, Tejas, et al.
Pubblicazione: (2024)
Towards Robust and Parameter-Efficient Knowledge Unlearning for LLMs
di: Cha, Sungmin, et al.
Pubblicazione: (2024)
di: Cha, Sungmin, et al.
Pubblicazione: (2024)
Leveraging Per-Instance Privacy for Machine Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2025)
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2025)
Toward Understanding Unlearning Difficulty: A Mechanistic Perspective and Circuit-Guided Difficulty Metric
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
di: Cheng, Jiali, et al.
Pubblicazione: (2026)
LLM Surgery: Efficient Knowledge Unlearning and Editing in Large Language Models
di: Veldanda, Akshaj Kumar, et al.
Pubblicazione: (2024)
di: Veldanda, Akshaj Kumar, et al.
Pubblicazione: (2024)
The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws
di: Jin, Tian, et al.
Pubblicazione: (2025)
di: Jin, Tian, et al.
Pubblicazione: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
The Non-Local Model Merging Problem: Permutation Symmetries and Variance Collapse
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
di: Sharma, Ekansh, et al.
Pubblicazione: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
di: Doshi, Jai, et al.
Pubblicazione: (2024)
di: Doshi, Jai, et al.
Pubblicazione: (2024)
Robust LLM Unlearning with MUDMAN: Meta-Unlearning with Disruption Masking And Normalization
di: Sondej, Filip, et al.
Pubblicazione: (2025)
di: Sondej, Filip, et al.
Pubblicazione: (2025)
Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data
di: Inane, Ahmed Mehdi, et al.
Pubblicazione: (2026)
di: Inane, Ahmed Mehdi, et al.
Pubblicazione: (2026)
GONE: Structural Knowledge Unlearning via Neighborhood-Expanded Distribution Shaping
di: Dahal, Chahana, et al.
Pubblicazione: (2026)
di: Dahal, Chahana, et al.
Pubblicazione: (2026)
Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
di: Yamashita, Tomoya, et al.
Pubblicazione: (2025)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
di: Chen, Hang, et al.
Pubblicazione: (2025)
di: Chen, Hang, et al.
Pubblicazione: (2025)
Identifying Spurious Biases Early in Training through the Lens of Simplicity Bias
di: Yang, Yu, et al.
Pubblicazione: (2023)
di: Yang, Yu, et al.
Pubblicazione: (2023)
Does Machine Unlearning Truly Remove Knowledge?
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
Towards Robust Evaluation of Unlearning in LLMs via Data Transformations
di: Joshi, Abhinav, et al.
Pubblicazione: (2024)
di: Joshi, Abhinav, et al.
Pubblicazione: (2024)
Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models
di: Mekala, Anmol, et al.
Pubblicazione: (2024)
di: Mekala, Anmol, et al.
Pubblicazione: (2024)
Mechanistic?
di: Saphra, Naomi, et al.
Pubblicazione: (2024)
di: Saphra, Naomi, et al.
Pubblicazione: (2024)
Leverage Unlearning to Sanitize LLMs
di: Boutet, Antoine, et al.
Pubblicazione: (2025)
di: Boutet, Antoine, et al.
Pubblicazione: (2025)
LLM Unlearning with LLM Beliefs
di: Li, Kemou, et al.
Pubblicazione: (2025)
di: Li, Kemou, et al.
Pubblicazione: (2025)
CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge
di: Bae, Seyun, et al.
Pubblicazione: (2026)
di: Bae, Seyun, et al.
Pubblicazione: (2026)
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
Automating Evaluation of Diffusion Model Unlearning with (Vision-) Language Model World Knowledge
di: Yeats, Eric, et al.
Pubblicazione: (2025)
di: Yeats, Eric, et al.
Pubblicazione: (2025)
$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
di: Li, Pengyu, et al.
Pubblicazione: (2026)
di: Li, Pengyu, et al.
Pubblicazione: (2026)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
di: Tang, Haoyu, et al.
Pubblicazione: (2024)
Dissecting Language Models: Machine Unlearning via Selective Pruning
di: Pochinkov, Nicholas, et al.
Pubblicazione: (2024)
di: Pochinkov, Nicholas, et al.
Pubblicazione: (2024)
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
di: Wang, Xu, et al.
Pubblicazione: (2025)
di: Wang, Xu, et al.
Pubblicazione: (2025)
LUME: LLM Unlearning with Multitask Evaluations
di: Ramakrishna, Anil, et al.
Pubblicazione: (2025)
di: Ramakrishna, Anil, et al.
Pubblicazione: (2025)
A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task
di: Brinkmann, Jannik, et al.
Pubblicazione: (2024)
di: Brinkmann, Jannik, et al.
Pubblicazione: (2024)
Geometric-disentangelment Unlearning
di: Zhou, Duo, et al.
Pubblicazione: (2025)
di: Zhou, Duo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Data Selection for Transfer Unlearning
di: Sepahvand, Nazanin Mohammadi, et al.
Pubblicazione: (2024) -
Improved Localized Machine Unlearning Through the Lens of Memorization
di: Torkzadehmahani, Reihaneh, et al.
Pubblicazione: (2024) -
Eight Methods to Evaluate Robust Unlearning in LLMs
di: Lynch, Aengus, et al.
Pubblicazione: (2024) -
Unlearning in- vs. out-of-distribution data in LLMs under gradient-based method
di: Baluta, Teodora, et al.
Pubblicazione: (2024) -
Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs
di: Sheshadri, Abhay, et al.
Pubblicazione: (2024)