UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Yijiang River, Lin, Hongzhou, Belkin, Mikhail, Huerta, Ramon, Vulić, Ivan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation
par: Li, Minchong, et autres
Publié: (2024)
par: Li, Minchong, et autres
Publié: (2024)
On Bilingual Lexicon Induction with Large Language Models
par: Li, Yaoyiran, et autres
Publié: (2023)
par: Li, Yaoyiran, et autres
Publié: (2023)
When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning
par: Dong, Yijiang River, et autres
Publié: (2025)
par: Dong, Yijiang River, et autres
Publié: (2025)
Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction
par: Pang, Jiayun, et autres
Publié: (2024)
par: Pang, Jiayun, et autres
Publié: (2024)
Large Language Models are Miscalibrated In-Context Learners
par: Li, Chengzu, et autres
Publié: (2023)
par: Li, Chengzu, et autres
Publié: (2023)
Scaling Sparse Fine-Tuning to Large Language Models
par: Ansell, Alan, et autres
Publié: (2024)
par: Ansell, Alan, et autres
Publié: (2024)
SLED: Self Logits Evolution Decoding for Improving Factuality in Large Language Models
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
Machine Unlearning in Large Language Models
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
par: Gundavarapu, Saaketh Koundinya, et autres
Publié: (2024)
Unlearning Traces the Influential Training Data of Language Models
par: Isonuma, Masaru, et autres
Publié: (2024)
par: Isonuma, Masaru, et autres
Publié: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
par: Lin, Yujie, et autres
Publié: (2026)
par: Lin, Yujie, et autres
Publié: (2026)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
Understanding the Dilemma of Unlearning for Large Language Models
par: Zhang, Qingjie, et autres
Publié: (2025)
par: Zhang, Qingjie, et autres
Publié: (2025)
MiniLLM: On-Policy Distillation of Large Language Models
par: Gu, Yuxian, et autres
Publié: (2023)
par: Gu, Yuxian, et autres
Publié: (2023)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
Self-Augmented In-Context Learning for Unsupervised Word Translation
par: Li, Yaoyiran, et autres
Publié: (2024)
par: Li, Yaoyiran, et autres
Publié: (2024)
Reversing the Forget-Retain Objectives: An Efficient LLM Unlearning Framework from Logit Difference
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
Large Language Model Unlearning
par: Yao, Yuanshun, et autres
Publié: (2023)
par: Yao, Yuanshun, et autres
Publié: (2023)
Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing
par: Mirtaheri, Parsa, et autres
Publié: (2026)
par: Mirtaheri, Parsa, et autres
Publié: (2026)
Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding
par: Schmidt, Fabian David, et autres
Publié: (2025)
par: Schmidt, Fabian David, et autres
Publié: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025)
par: Ye, Tianzhu, et autres
Publié: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
par: Lin, Liang, et autres
Publié: (2026)
par: Lin, Liang, et autres
Publié: (2026)
Structured Agent Distillation for Large Language Model
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
par: Cheng, Xueqi, et autres
Publié: (2026)
par: Cheng, Xueqi, et autres
Publié: (2026)
On Effects of Steering Latent Representation for Large Language Model Unlearning
par: Huu-Tien, Dang, et autres
Publié: (2024)
par: Huu-Tien, Dang, et autres
Publié: (2024)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
Offset Unlearning for Large Language Models
par: Huang, James Y., et autres
Publié: (2024)
par: Huang, James Y., et autres
Publié: (2024)
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
A Closer Look at Machine Unlearning for Large Language Models
par: Yuan, Xiaojian, et autres
Publié: (2024)
par: Yuan, Xiaojian, et autres
Publié: (2024)
Vocabulary Expansion of Large Language Models via Kullback-Leibler-Based Self-Distillation
par: Linder, Max Rehman
Publié: (2025)
par: Linder, Max Rehman
Publié: (2025)
Steering Language Models Before They Speak: Logit-Level Interventions
par: An, Hyeseon, et autres
Publié: (2026)
par: An, Hyeseon, et autres
Publié: (2026)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
par: Fu, Deqing, et autres
Publié: (2026)
par: Fu, Deqing, et autres
Publié: (2026)
Segment Any Text: A Universal Approach for Robust, Efficient and Adaptable Sentence Segmentation
par: Frohmann, Markus, et autres
Publié: (2024)
par: Frohmann, Markus, et autres
Publié: (2024)
A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models
par: Geng, Jiahui, et autres
Publié: (2025)
par: Geng, Jiahui, et autres
Publié: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
par: Lee, Hong kyu, et autres
Publié: (2025)
par: Lee, Hong kyu, et autres
Publié: (2025)
Donors and Recipients: On Asymmetric Transfer Across Tasks and Languages with Parameter-Efficient Fine-Tuning
par: Dymkiewicz, Kajetan, et autres
Publié: (2025)
par: Dymkiewicz, Kajetan, et autres
Publié: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
par: Dong, Qingxiu, et autres
Publié: (2024)
par: Dong, Qingxiu, et autres
Publié: (2024)
Hierarchical Federated Unlearning for Large Language Models
par: Zhong, Yisheng, et autres
Publié: (2025)
par: Zhong, Yisheng, et autres
Publié: (2025)
Documents similaires
-
BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation
par: Li, Minchong, et autres
Publié: (2024) -
On Bilingual Lexicon Induction with Large Language Models
par: Li, Yaoyiran, et autres
Publié: (2023) -
When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning
par: Dong, Yijiang River, et autres
Publié: (2025) -
Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction
par: Pang, Jiayun, et autres
Publié: (2024) -
Large Language Models are Miscalibrated In-Context Learners
par: Li, Chengzu, et autres
Publié: (2023)