Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Changsheng, Zhang, Yihua, Jia, Jinghan, Ram, Parikshit, Wei, Dennis, Yao, Yuguang, Pal, Soumyadeep, Baracaldo, Nathalie, Liu, Sijia |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skills
by: Wang, Changsheng, et al.
Published: (2025)
by: Wang, Changsheng, et al.
Published: (2025)
WAGLE: Strategic Weight Attribution for Effective and Modular Unlearning in Large Language Models
by: Jia, Jinghan, et al.
Published: (2024)
by: Jia, Jinghan, et al.
Published: (2024)
LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data
by: Wang, Changsheng, et al.
Published: (2025)
by: Wang, Changsheng, et al.
Published: (2025)
Model Sparsity Can Simplify Machine Unlearning
by: Jia, Jinghan, et al.
Published: (2023)
by: Jia, Jinghan, et al.
Published: (2023)
Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
by: Lang, Yicheng, et al.
Published: (2025)
by: Lang, Yicheng, et al.
Published: (2025)
Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability
by: Jia, Jinghan, et al.
Published: (2025)
by: Jia, Jinghan, et al.
Published: (2025)
LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
by: Fan, Chongyu, et al.
Published: (2025)
by: Fan, Chongyu, et al.
Published: (2025)
LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks
by: Pal, Soumyadeep, et al.
Published: (2025)
by: Pal, Soumyadeep, et al.
Published: (2025)
Towards LLM Unlearning Resilient to Relearning Attacks: A Sharpness-Aware Minimization Perspective and Beyond
by: Fan, Chongyu, et al.
Published: (2025)
by: Fan, Chongyu, et al.
Published: (2025)
Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective
by: Fernando, Heshan, et al.
Published: (2024)
by: Fernando, Heshan, et al.
Published: (2024)
Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
by: Chen, Yiwei, et al.
Published: (2025)
by: Chen, Yiwei, et al.
Published: (2025)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
by: Pal, Soumyadeep, et al.
Published: (2024)
by: Pal, Soumyadeep, et al.
Published: (2024)
Leak@$k$: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding
by: Reisizadeh, Hadi, et al.
Published: (2025)
by: Reisizadeh, Hadi, et al.
Published: (2025)
Rethinking Machine Unlearning for Large Language Models
by: Liu, Sijia, et al.
Published: (2024)
by: Liu, Sijia, et al.
Published: (2024)
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
by: Zhang, Yihua, et al.
Published: (2024)
by: Zhang, Yihua, et al.
Published: (2024)
Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs
by: Chen, Yiwei, et al.
Published: (2025)
by: Chen, Yiwei, et al.
Published: (2025)
SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning
by: Jia, Jinghan, et al.
Published: (2024)
by: Jia, Jinghan, et al.
Published: (2024)
EPiC: Towards Lossless Speedup for Reasoning Training through Edge-Preserving CoT Condensation
by: Jia, Jinghan, et al.
Published: (2025)
by: Jia, Jinghan, et al.
Published: (2025)
Split, Unlearn, Merge: Leveraging Data Attributes for More Effective Unlearning in LLMs
by: Kadhe, Swanand Ravindra, et al.
Published: (2024)
by: Kadhe, Swanand Ravindra, et al.
Published: (2024)
SEUF: Is Unlearning One Expert Enough for Mixture-of-Experts LLMs?
by: Zhuang, Haomin, et al.
Published: (2024)
by: Zhuang, Haomin, et al.
Published: (2024)
The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning
by: Shah, Raj Sanjay, et al.
Published: (2026)
by: Shah, Raj Sanjay, et al.
Published: (2026)
Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
by: Gu, Renjie, et al.
Published: (2026)
by: Gu, Renjie, et al.
Published: (2026)
Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
by: Wang, Changsheng, et al.
Published: (2025)
by: Wang, Changsheng, et al.
Published: (2025)
Forget Vectors at Play: Universal Input Perturbations Driving Machine Unlearning in Image Classification
by: Sun, Changchang, et al.
Published: (2024)
by: Sun, Changchang, et al.
Published: (2024)
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
by: Fan, Chongyu, et al.
Published: (2024)
by: Fan, Chongyu, et al.
Published: (2024)
To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now
by: Zhang, Yimeng, et al.
Published: (2023)
by: Zhang, Yimeng, et al.
Published: (2023)
Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
by: Li, Boheng, et al.
Published: (2025)
by: Li, Boheng, et al.
Published: (2025)
Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered
by: Liu, Sijia, et al.
Published: (2026)
by: Liu, Sijia, et al.
Published: (2026)
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
by: Zhang, Yimeng, et al.
Published: (2024)
by: Zhang, Yimeng, et al.
Published: (2024)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
by: Shang, Bingqi, et al.
Published: (2025)
by: Shang, Bingqi, et al.
Published: (2025)
Enhancing In-context Learning via Linear Probe Calibration
by: Abbas, Momin, et al.
Published: (2024)
by: Abbas, Momin, et al.
Published: (2024)
Balancing Multi-modal Sensor Learning via Multi-objective Optimization
by: Fernando, Heshan, et al.
Published: (2025)
by: Fernando, Heshan, et al.
Published: (2025)
CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling
by: Fan, Chongyu, et al.
Published: (2025)
by: Fan, Chongyu, et al.
Published: (2025)
BLUR: A Bi-Level Optimization Approach for LLM Unlearning
by: Reisizadeh, Hadi, et al.
Published: (2025)
by: Reisizadeh, Hadi, et al.
Published: (2025)
SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation
by: Fan, Chongyu, et al.
Published: (2023)
by: Fan, Chongyu, et al.
Published: (2023)
Label Smoothing Improves Machine Unlearning
by: Di, Zonglin, et al.
Published: (2024)
by: Di, Zonglin, et al.
Published: (2024)
In-Context Probing for Membership Inference in Fine-Tuned Language Models
by: Lu, Zhexi, et al.
Published: (2025)
by: Lu, Zhexi, et al.
Published: (2025)
One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
by: Zhang, Mohan, et al.
Published: (2025)
by: Zhang, Mohan, et al.
Published: (2025)
On the Utility of Domain-Adjacent Fine-Tuned Model Ensembles for Few-shot Problems
by: Alam, Md Ibrahim Ibne, et al.
Published: (2024)
by: Alam, Md Ibrahim Ibne, et al.
Published: (2024)
Adversarial Watermarking for Face Recognition
by: Yao, Yuguang, et al.
Published: (2024)
by: Yao, Yuguang, et al.
Published: (2024)
Similar Items
-
Reasoning Model Unlearning: Forgetting Traces, Not Just Answers, While Preserving Reasoning Skills
by: Wang, Changsheng, et al.
Published: (2025) -
WAGLE: Strategic Weight Attribution for Effective and Modular Unlearning in Large Language Models
by: Jia, Jinghan, et al.
Published: (2024) -
LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data
by: Wang, Changsheng, et al.
Published: (2025) -
Model Sparsity Can Simplify Machine Unlearning
by: Jia, Jinghan, et al.
Published: (2023) -
Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
by: Lang, Yicheng, et al.
Published: (2025)