Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Chongyu, Jia, Jinghan, Zhang, Yihua, Ramakrishna, Anil, Hong, Mingyi, Liu, Sijia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
par: Lang, Yicheng, et autres
Publié: (2025)
par: Lang, Yicheng, et autres
Publié: (2025)
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
par: Fan, Chongyu, et autres
Publié: (2024)
par: Fan, Chongyu, et autres
Publié: (2024)
SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
par: Jia, Jinghan, et autres
Publié: (2024)
par: Jia, Jinghan, et autres
Publié: (2024)
CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling
par: Fan, Chongyu, et autres
Publié: (2025)
par: Fan, Chongyu, et autres
Publié: (2025)
BLUR: A Bi-Level Optimization Approach for LLM Unlearning
par: Reisizadeh, Hadi, et autres
Publié: (2025)
par: Reisizadeh, Hadi, et autres
Publié: (2025)
EPiC: Towards Lossless Speedup for Reasoning Training through Edge-Preserving CoT Condensation
par: Jia, Jinghan, et autres
Publié: (2025)
par: Jia, Jinghan, et autres
Publié: (2025)
LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
par: Fan, Chongyu, et autres
Publié: (2025)
par: Fan, Chongyu, et autres
Publié: (2025)
SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?
par: Zhuang, Haomin, et autres
Publié: (2024)
par: Zhuang, Haomin, et autres
Publié: (2024)
LUME: LLM Unlearning with Multitask Evaluations
par: Ramakrishna, Anil, et autres
Publié: (2025)
par: Ramakrishna, Anil, et autres
Publié: (2025)
Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skills
par: Wang, Changsheng, et autres
Publié: (2025)
par: Wang, Changsheng, et autres
Publié: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
par: Shang, Bingqi, et autres
Publié: (2025)
par: Shang, Bingqi, et autres
Publié: (2025)
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
par: Zhang, Yimeng, et autres
Publié: (2024)
par: Zhang, Yimeng, et autres
Publié: (2024)
Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning
par: Wang, Changsheng, et autres
Publié: (2025)
par: Wang, Changsheng, et autres
Publié: (2025)
Unlearning as multi-task optimization: A normalized gradient difference approach with an adaptive learning rate
par: Bu, Zhiqi, et autres
Publié: (2024)
par: Bu, Zhiqi, et autres
Publié: (2024)
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
par: Fan, Chongyu, et autres
Publié: (2026)
par: Fan, Chongyu, et autres
Publié: (2026)
LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data
par: Wang, Changsheng, et autres
Publié: (2025)
par: Wang, Changsheng, et autres
Publié: (2025)
SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models
par: Ramakrishna, Anil, et autres
Publié: (2025)
par: Ramakrishna, Anil, et autres
Publié: (2025)
SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation
par: Fan, Chongyu, et autres
Publié: (2023)
par: Fan, Chongyu, et autres
Publié: (2023)
Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter
par: Xiao, Zeguan, et autres
Publié: (2026)
par: Xiao, Zeguan, et autres
Publié: (2026)
WAGLE: Strategic Weight Attribution for Effective and Modular Unlearning in Large Language Models
par: Jia, Jinghan, et autres
Publié: (2024)
par: Jia, Jinghan, et autres
Publié: (2024)
Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts
par: Gao, Hongcheng, et autres
Publié: (2024)
par: Gao, Hongcheng, et autres
Publié: (2024)
Unlearning's Blind Spots: Over-Unlearning and Prototypical Relearning Attack
par: Ha, SeungBum, et autres
Publié: (2025)
par: Ha, SeungBum, et autres
Publié: (2025)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
par: Jia, Jinghan, et autres
Publié: (2025)
par: Jia, Jinghan, et autres
Publié: (2025)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
par: Gu, Renjie, et autres
Publié: (2026)
par: Gu, Renjie, et autres
Publié: (2026)
Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine Unlearning
par: Fan, Chongyu, et autres
Publié: (2024)
par: Fan, Chongyu, et autres
Publié: (2024)
Constrained Entropic Unlearning: A Primal-Dual Framework for Large Language Models
par: Entesari, Taha, et autres
Publié: (2025)
par: Entesari, Taha, et autres
Publié: (2025)
Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark
par: Zhang, Yihua, et autres
Publié: (2024)
par: Zhang, Yihua, et autres
Publié: (2024)
Beyond Superficial Unlearning: Sharpness-Aware Robust Erasure of Hallucinations in Multimodal LLMs
par: Fang, Xianya, et autres
Publié: (2026)
par: Fang, Xianya, et autres
Publié: (2026)
Layered Unlearning for Adversarial Relearning
par: Qian, Timothy, et autres
Publié: (2025)
par: Qian, Timothy, et autres
Publié: (2025)
Rethinking Machine Unlearning for Large Language Models
par: Liu, Sijia, et autres
Publié: (2024)
par: Liu, Sijia, et autres
Publié: (2024)
Forget Vectors at Play: Universal Input Perturbations Driving Machine Unlearning in Image Classification
par: Sun, Changchang, et autres
Publié: (2024)
par: Sun, Changchang, et autres
Publié: (2024)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
par: Sherborne, Tom, et autres
Publié: (2023)
par: Sherborne, Tom, et autres
Publié: (2023)
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
par: Zhang, Yihua, et autres
Publié: (2024)
par: Zhang, Yihua, et autres
Publié: (2024)
LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks
par: Pal, Soumyadeep, et autres
Publié: (2025)
par: Pal, Soumyadeep, et autres
Publié: (2025)
CURE:Circuit-Aware Unlearning for LLM-based Recommendation
par: Chen, Ziheng, et autres
Publié: (2026)
par: Chen, Ziheng, et autres
Publié: (2026)
Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
LLM Unlearning Without an Expert Curated Dataset
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
par: Shin, Jeongjin, et autres
Publié: (2024)
par: Shin, Jeongjin, et autres
Publié: (2024)
Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates
par: Nguyen, Duy, et autres
Publié: (2026)
par: Nguyen, Duy, et autres
Publié: (2026)
Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning
par: Hu, Shengyuan, et autres
Publié: (2024)
par: Hu, Shengyuan, et autres
Publié: (2024)
Documents similaires
-
Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
par: Lang, Yicheng, et autres
Publié: (2025) -
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
par: Fan, Chongyu, et autres
Publié: (2024) -
SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
par: Jia, Jinghan, et autres
Publié: (2024) -
CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling
par: Fan, Chongyu, et autres
Publié: (2025) -
BLUR: A Bi-Level Optimization Approach for LLM Unlearning
par: Reisizadeh, Hadi, et autres
Publié: (2025)