Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Jiawei, Zhou, Doudou |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens
von: Koh, Seunghee, et al.
Veröffentlicht: (2026)
von: Koh, Seunghee, et al.
Veröffentlicht: (2026)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
von: Wan, Yixin, et al.
Veröffentlicht: (2025)
von: Wan, Yixin, et al.
Veröffentlicht: (2025)
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
von: Lee, Hwiyeong, et al.
Veröffentlicht: (2025)
von: Lee, Hwiyeong, et al.
Veröffentlicht: (2025)
GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models
von: Niu, Peizhi, et al.
Veröffentlicht: (2025)
von: Niu, Peizhi, et al.
Veröffentlicht: (2025)
UniErase: Towards Balanced and Precise Unlearning in Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2025)
von: Yu, Miao, et al.
Veröffentlicht: (2025)
Evaluating Deep Unlearning in Large Language Models
von: Wu, Ruihan, et al.
Veröffentlicht: (2024)
von: Wu, Ruihan, et al.
Veröffentlicht: (2024)
Which Retain Set Matters for LLM Unlearning? A Case Study on Entity Unlearning
von: Chang, Hwan, et al.
Veröffentlicht: (2025)
von: Chang, Hwan, et al.
Veröffentlicht: (2025)
Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models
von: Tang, Haoyu, et al.
Veröffentlicht: (2024)
von: Tang, Haoyu, et al.
Veröffentlicht: (2024)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
von: Kadhe, Swanand Ravindra, et al.
Veröffentlicht: (2024)
von: Kadhe, Swanand Ravindra, et al.
Veröffentlicht: (2024)
CodeUnlearn: Amortized Zero-Shot Machine Unlearning in Language Models Using Discrete Concept
von: Wu, YuXuan, et al.
Veröffentlicht: (2024)
von: Wu, YuXuan, et al.
Veröffentlicht: (2024)
Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
von: Chen, Haokun, et al.
Veröffentlicht: (2025)
von: Chen, Haokun, et al.
Veröffentlicht: (2025)
Unveiling Entity-Level Unlearning for Large Language Models: A Comprehensive Analysis
von: Ma, Weitao, et al.
Veröffentlicht: (2024)
von: Ma, Weitao, et al.
Veröffentlicht: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
Offset Unlearning for Large Language Models
von: Huang, James Y., et al.
Veröffentlicht: (2024)
von: Huang, James Y., et al.
Veröffentlicht: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
von: Lin, Yujie, et al.
Veröffentlicht: (2026)
Unlearning Climate Misinformation in Large Language Models
von: Fore, Michael, et al.
Veröffentlicht: (2024)
von: Fore, Michael, et al.
Veröffentlicht: (2024)
A Survey on Unlearning in Large Language Models
von: Qiu, Ruichen, et al.
Veröffentlicht: (2025)
von: Qiu, Ruichen, et al.
Veröffentlicht: (2025)
Large Language Model Unlearning
von: Yao, Yuanshun, et al.
Veröffentlicht: (2023)
von: Yao, Yuanshun, et al.
Veröffentlicht: (2023)
Deep Contrastive Unlearning for Language Models
von: He, Estrid, et al.
Veröffentlicht: (2025)
von: He, Estrid, et al.
Veröffentlicht: (2025)
Machine Unlearning in Large Language Models
von: Gundavarapu, Saaketh Koundinya, et al.
Veröffentlicht: (2024)
von: Gundavarapu, Saaketh Koundinya, et al.
Veröffentlicht: (2024)
Soft Prompting for Unlearning in Large Language Models
von: Bhaila, Karuna, et al.
Veröffentlicht: (2024)
von: Bhaila, Karuna, et al.
Veröffentlicht: (2024)
Investigating Model Editing for Unlearning in Large Language Models
von: Hossain, Shariqah, et al.
Veröffentlicht: (2025)
von: Hossain, Shariqah, et al.
Veröffentlicht: (2025)
Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport
von: Choi, Minseok, et al.
Veröffentlicht: (2024)
von: Choi, Minseok, et al.
Veröffentlicht: (2024)
Second-Order Information Matters: Revisiting Machine Unlearning for Large Language Models
von: Gu, Kang, et al.
Veröffentlicht: (2024)
von: Gu, Kang, et al.
Veröffentlicht: (2024)
Model Unlearning Objectives Vary for Distinct Language Functions
von: Atil, Berk, et al.
Veröffentlicht: (2026)
von: Atil, Berk, et al.
Veröffentlicht: (2026)
Evaluating Cross-Lingual Unlearning in Multilingual Language Models
von: Lizzo, Tyler, et al.
Veröffentlicht: (2026)
von: Lizzo, Tyler, et al.
Veröffentlicht: (2026)
Mitigating Biases in Language Models via Bias Unlearning
von: Liu, Dianqing, et al.
Veröffentlicht: (2025)
von: Liu, Dianqing, et al.
Veröffentlicht: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
von: Tran, Toan, et al.
Veröffentlicht: (2025)
von: Tran, Toan, et al.
Veröffentlicht: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
Exclusive Unlearning
von: Sasaki, Mutsumi, et al.
Veröffentlicht: (2026)
von: Sasaki, Mutsumi, et al.
Veröffentlicht: (2026)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
von: Yang, Zhengbang, et al.
Veröffentlicht: (2026)
von: Yang, Zhengbang, et al.
Veröffentlicht: (2026)
Understanding the Dilemma of Unlearning for Large Language Models
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
von: Zhang, Qingjie, et al.
Veröffentlicht: (2025)
Rethinking Machine Unlearning for Large Language Models
von: Liu, Sijia, et al.
Veröffentlicht: (2024)
von: Liu, Sijia, et al.
Veröffentlicht: (2024)
Learning and Unlearning of Fabricated Knowledge in Language Models
von: Sun, Chen, et al.
Veröffentlicht: (2024)
von: Sun, Chen, et al.
Veröffentlicht: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
von: Spohn, Philipp, et al.
Veröffentlicht: (2025)
von: Spohn, Philipp, et al.
Veröffentlicht: (2025)
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
von: Doshi, Jai, et al.
Veröffentlicht: (2024)
von: Doshi, Jai, et al.
Veröffentlicht: (2024)
Token-Level Precise Attack on RAG: Searching for the Best Alternatives to Mislead Generation
von: Li, Zizhong, et al.
Veröffentlicht: (2025)
von: Li, Zizhong, et al.
Veröffentlicht: (2025)
Guardrail Baselines for Unlearning in LLMs
von: Thaker, Pratiksha, et al.
Veröffentlicht: (2024)
von: Thaker, Pratiksha, et al.
Veröffentlicht: (2024)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
von: Muhamed, Aashiq, et al.
Veröffentlicht: (2025)
Towards Safer Large Language Models through Machine Unlearning
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens
von: Koh, Seunghee, et al.
Veröffentlicht: (2026) -
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
von: Wan, Yixin, et al.
Veröffentlicht: (2025) -
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
von: Lee, Hwiyeong, et al.
Veröffentlicht: (2025) -
GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models
von: Niu, Peizhi, et al.
Veröffentlicht: (2025) -
UniErase: Towards Balanced and Precise Unlearning in Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2025)