SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Zizhao, Godbole, Ameya, Wei, Johnny Tian-Zheng, Rostami, Mohammad, Thomason, Jesse, Jia, Robin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
par: Hu, Zizhao, et autres
Publié: (2026)
par: Hu, Zizhao, et autres
Publié: (2026)
Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2025)
par: Hu, Zizhao, et autres
Publié: (2025)
Spiking the training data to correct for test set contamination
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2026)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2026)
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
par: Cai, Yuliang, et autres
Publié: (2025)
par: Cai, Yuliang, et autres
Publié: (2025)
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2024)
par: Hu, Zizhao, et autres
Publié: (2024)
Verify with Caution: The Pitfalls of Relying on Imperfect Factuality Metrics
par: Godbole, Ameya, et autres
Publié: (2025)
par: Godbole, Ameya, et autres
Publié: (2025)
SCENE: Self-Labeled Counterfactuals for Extrapolating to Negative Examples
par: Fu, Deqing, et autres
Publié: (2023)
par: Fu, Deqing, et autres
Publié: (2023)
Interrogating LLM design under a fair learning doctrine
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2025)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2025)
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models
par: Dong, Yijiang River, et autres
Publié: (2024)
par: Dong, Yijiang River, et autres
Publié: (2024)
Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback
par: Zhu, Wang, et autres
Publié: (2024)
par: Zhu, Wang, et autres
Publié: (2024)
Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
par: Yang, Wei, et autres
Publié: (2025)
par: Yang, Wei, et autres
Publié: (2025)
Why Do Some Inputs Break Low-Bit LLM Quantization?
par: Chang, Ting-Yun, et autres
Publié: (2025)
par: Chang, Ting-Yun, et autres
Publié: (2025)
Lateralization MLP: A Simple Brain-inspired Architecture for Diffusion
par: Hu, Zizhao, et autres
Publié: (2024)
par: Hu, Zizhao, et autres
Publié: (2024)
Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation
par: Zhong, Yisheng, et autres
Publié: (2026)
par: Zhong, Yisheng, et autres
Publié: (2026)
PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking
par: Zhu, Wang Bill, et autres
Publié: (2026)
par: Zhu, Wang Bill, et autres
Publié: (2026)
TokenSmith: Streamlining Data Editing, Search, and Inspection for Large-Scale Language Model Training and Interpretability
par: Khan, Mohammad Aflah, et autres
Publié: (2025)
par: Khan, Mohammad Aflah, et autres
Publié: (2025)
Is Retain Set All You Need in Machine Unlearning? Restoring Performance of Unlearned Models with Out-Of-Distribution Images
par: Bonato, Jacopo, et autres
Publié: (2024)
par: Bonato, Jacopo, et autres
Publié: (2024)
Adjust for Trust: Mitigating Trust-Induced Inappropriate Reliance on AI Assistance
par: Srinivasan, Tejas, et autres
Publié: (2025)
par: Srinivasan, Tejas, et autres
Publié: (2025)
BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap
par: Hu, Shengyuan, et autres
Publié: (2025)
par: Hu, Shengyuan, et autres
Publié: (2025)
Static Key Attention in Vision
par: Hu, Zizhao, et autres
Publié: (2024)
par: Hu, Zizhao, et autres
Publié: (2024)
Peak-Controlled Logits Poisoning Attack in Federated Distillation
par: Tang, Yuhan, et autres
Publié: (2024)
par: Tang, Yuhan, et autres
Publié: (2024)
Federated Progressive Self-Distillation with Logits Calibration for Personalized IIoT Edge Intelligence
par: Wang, Yingchao, et autres
Publié: (2024)
par: Wang, Yingchao, et autres
Publié: (2024)
Demoting Security via Exploitation of Cache Demote Operation in Intel's Latest ISA Extension
par: Kim, Taehun, et autres
Publié: (2025)
par: Kim, Taehun, et autres
Publié: (2025)
M3PT: A Transformer for Multimodal, Multi-Party Social Signal Prediction with Person-aware Blockwise Attention
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
Logit Distillation on Manifolds: Mapping by Learning
par: Yang, Yiru, et autres
Publié: (2026)
par: Yang, Yiru, et autres
Publié: (2026)
The statistical advantage of automatic NLG metrics at the system level
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2021)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2021)
Do Localization Methods Actually Localize Memorized Data in LLMs? A Tale of Two Benchmarks
par: Chang, Ting-Yun, et autres
Publié: (2023)
par: Chang, Ting-Yun, et autres
Publié: (2023)
When Parts Are Greater Than Sums: Individual LLM Components Can Outperform Full Models
par: Chang, Ting-Yun, et autres
Publié: (2024)
par: Chang, Ting-Yun, et autres
Publié: (2024)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
par: Zhu, Wang, et autres
Publié: (2023)
par: Zhu, Wang, et autres
Publié: (2023)
CS-SHRED: Enhancing SHRED for Robust Recovery of Spatiotemporal Dynamics
par: da Silva, Romulo B., et autres
Publié: (2025)
par: da Silva, Romulo B., et autres
Publié: (2025)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
par: Yang, Yuxiao, et autres
Publié: (2026)
par: Yang, Yuxiao, et autres
Publié: (2026)
Words that make SENSE: Sensorimotor Norms in Learned Lexical Token Representations
par: Gupta, Abhinav, et autres
Publié: (2026)
par: Gupta, Abhinav, et autres
Publié: (2026)
Hubble: a Model Suite to Advance the Study of LLM Memorization
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2025)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2025)
Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
par: Yang, Wei, et autres
Publié: (2025)
par: Yang, Wei, et autres
Publié: (2025)
Distillation Robustifies Unlearning
par: Lee, Bruce W., et autres
Publié: (2025)
par: Lee, Bruce W., et autres
Publié: (2025)
Synthetic Data for Robust AI Model Development in Regulated Enterprises
par: Godbole, Aditi
Publié: (2025)
par: Godbole, Aditi
Publié: (2025)
Corrective Machine Unlearning
par: Goel, Shashwat, et autres
Publié: (2024)
par: Goel, Shashwat, et autres
Publié: (2024)
Iterative Formalization and Planning in Partially Observable Environments
par: Gong, Liancheng, et autres
Publié: (2025)
par: Gong, Liancheng, et autres
Publié: (2025)
Proving membership in LLM pretraining data via data watermarks
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2024)
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2024)
Documents similaires
-
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
par: Hu, Zizhao, et autres
Publié: (2026) -
Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2025) -
Spiking the training data to correct for test set contamination
par: Wei, Johnny Tian-Zheng, et autres
Publié: (2026) -
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
par: Cai, Yuliang, et autres
Publié: (2025) -
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2024)