SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Muhamed, Aashiq, Bonato, Jacopo, Diab, Mona, Smith, Virginia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
CoRAG: Collaborative Retrieval-Augmented Generation
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
par: Wedgwood, James, et autres
Publié: (2026)
par: Wedgwood, James, et autres
Publié: (2026)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
par: Song, Xiangchen, et autres
Publié: (2025)
par: Song, Xiangchen, et autres
Publié: (2025)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Textual Unlearning Gives a False Sense of Unlearning
par: Du, Jiacheng, et autres
Publié: (2024)
par: Du, Jiacheng, et autres
Publié: (2024)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
par: Wu, Xiaoyu, et autres
Publié: (2025)
par: Wu, Xiaoyu, et autres
Publié: (2025)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
par: Shumailov, Ilia, et autres
Publié: (2024)
par: Shumailov, Ilia, et autres
Publié: (2024)
Personal Information Parroting in Language Models
par: Subramani, Nishant, et autres
Publié: (2026)
par: Subramani, Nishant, et autres
Publié: (2026)
An Adversarial Perspective on Machine Unlearning for AI Safety
par: Łucki, Jakub, et autres
Publié: (2024)
par: Łucki, Jakub, et autres
Publié: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Unlink to Unlearn: Simplifying Edge Unlearning in GNNs
par: Tan, Jiajun, et autres
Publié: (2024)
par: Tan, Jiajun, et autres
Publié: (2024)
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning
par: Spracklen, Joseph, et autres
Publié: (2026)
par: Spracklen, Joseph, et autres
Publié: (2026)
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Fast Exact Unlearning for In-Context Learning Data for LLMs
par: Muresanu, Andrei I., et autres
Publié: (2024)
par: Muresanu, Andrei I., et autres
Publié: (2024)
Machine Unlearning with Minimal Gradient Dependence for High Unlearning Ratios
par: Huang, Tao, et autres
Publié: (2024)
par: Huang, Tao, et autres
Publié: (2024)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
GraphToxin: Reconstructing Full Unlearned Graphs from Graph Unlearning
par: Song, Ying, et autres
Publié: (2025)
par: Song, Ying, et autres
Publié: (2025)
Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs
par: P, Dinesh Srivasthav, et autres
Publié: (2026)
par: P, Dinesh Srivasthav, et autres
Publié: (2026)
Towards Understanding the Robustness of Sparse Autoencoders
par: Saiyed, Ahson, et autres
Publié: (2026)
par: Saiyed, Ahson, et autres
Publié: (2026)
Towards Lifecycle Unlearning Commitment Management: Measuring Sample-level Unlearning Completeness
par: Wang, Cheng-Long, et autres
Publié: (2025)
par: Wang, Cheng-Long, et autres
Publié: (2025)
Data-Free Privacy-Preserving for LLMs via Model Inversion and Selective Unlearning
par: Zhou, Xinjie, et autres
Publié: (2026)
par: Zhou, Xinjie, et autres
Publié: (2026)
Recalling The Forgotten Class Memberships: Unlearned Models Can Be Noisy Labelers to Leak Privacy
par: Sui, Zhihao, et autres
Publié: (2025)
par: Sui, Zhihao, et autres
Publié: (2025)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
par: Hu, Man, et autres
Publié: (2025)
par: Hu, Man, et autres
Publié: (2025)
Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods
par: Jang, Yeonwoo, et autres
Publié: (2025)
par: Jang, Yeonwoo, et autres
Publié: (2025)
CCRS: A Zero-Shot LLM-as-a-Judge Framework for Comprehensive RAG Evaluation
par: Muhamed, Aashiq
Publié: (2025)
par: Muhamed, Aashiq
Publié: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
par: To, Bang Trinh Tran, et autres
Publié: (2025)
par: To, Bang Trinh Tran, et autres
Publié: (2025)
Unlearning Inversion Attacks for Graph Neural Networks
par: Zhang, Jiahao, et autres
Publié: (2025)
par: Zhang, Jiahao, et autres
Publié: (2025)
SoK: Unlearnability and Unlearning for Model Dememorization
par: Zhang, Mengying, et autres
Publié: (2026)
par: Zhang, Mengying, et autres
Publié: (2026)
Forgetting-MarI: LLM Unlearning via Marginal Information Regularization
par: Xu, Shizhou, et autres
Publié: (2025)
par: Xu, Shizhou, et autres
Publié: (2025)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
par: Wen, Xiaofei, et autres
Publié: (2025)
par: Wen, Xiaofei, et autres
Publié: (2025)
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
par: Zhong, Ziqian, et autres
Publié: (2026)
par: Zhong, Ziqian, et autres
Publié: (2026)
In-Context Unlearning: Language Models as Few Shot Unlearners
par: Pawelczyk, Martin, et autres
Publié: (2023)
par: Pawelczyk, Martin, et autres
Publié: (2023)
WARP: Weight Teleportation for Attack-Resilient Unlearning Protocols
par: Maheri, Mohammad M, et autres
Publié: (2025)
par: Maheri, Mohammad M, et autres
Publié: (2025)
Scalable Federated Unlearning via Isolated and Coded Sharding
par: Lin, Yijing, et autres
Publié: (2024)
par: Lin, Yijing, et autres
Publié: (2024)
Documents similaires
-
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024) -
CoRAG: Collaborative Retrieval-Augmented Generation
par: Muhamed, Aashiq, et autres
Publié: (2025) -
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
par: Wedgwood, James, et autres
Publié: (2026) -
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
par: Song, Xiangchen, et autres
Publié: (2025) -
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025)