OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Xiaoyu, Du, Minxin, Ye, Qingqing, Hu, Haibo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents
par: Xu, Xiaoyu, et autres
Publié: (2026)
par: Xu, Xiaoyu, et autres
Publié: (2026)
Does Low Rank Adaptation Lead to Lower Robustness against Training-Time Attacks?
par: Liang, Zi, et autres
Publié: (2025)
par: Liang, Zi, et autres
Publié: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Textual Unlearning Gives a False Sense of Unlearning
par: Du, Jiacheng, et autres
Publié: (2024)
par: Du, Jiacheng, et autres
Publié: (2024)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
par: Wu, Xiaoyu, et autres
Publié: (2025)
par: Wu, Xiaoyu, et autres
Publié: (2025)
An Adversarial Perspective on Machine Unlearning for AI Safety
par: Łucki, Jakub, et autres
Publié: (2024)
par: Łucki, Jakub, et autres
Publié: (2024)
Directional Embedding Smoothing for Robust Vision Language Models
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Harry Potter is Still Here! Probing Knowledge Leakage in Targeted Unlearned Large Language Models via Automated Adversarial Prompting
par: To, Bang Trinh Tran, et autres
Publié: (2025)
par: To, Bang Trinh Tran, et autres
Publié: (2025)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
par: Gu, Tianle, et autres
Publié: (2025)
par: Gu, Tianle, et autres
Publié: (2025)
PostMark: A Robust Blackbox Watermark for Large Language Models
par: Chang, Yapei, et autres
Publié: (2024)
par: Chang, Yapei, et autres
Publié: (2024)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
par: Xu, Yijie, et autres
Publié: (2025)
par: Xu, Yijie, et autres
Publié: (2025)
UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI
par: Shumailov, Ilia, et autres
Publié: (2024)
par: Shumailov, Ilia, et autres
Publié: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Instructional Fingerprinting of Large Language Models
par: Xu, Jiashu, et autres
Publié: (2024)
par: Xu, Jiashu, et autres
Publié: (2024)
TurboFuzzLLM: Turbocharging Mutation-based Fuzzing for Effectively Jailbreaking Large Language Models in Practice
par: Goel, Aman, et autres
Publié: (2025)
par: Goel, Aman, et autres
Publié: (2025)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
On Adversarial Robustness of Language Models in Transfer Learning
par: Turbal, Bohdan, et autres
Publié: (2024)
par: Turbal, Bohdan, et autres
Publié: (2024)
Taylor Unswift: Secured Weight Release for Large Language Models via Taylor Expansion
par: Wang, Guanchu, et autres
Publié: (2024)
par: Wang, Guanchu, et autres
Publié: (2024)
On the Role of Attention Heads in Large Language Model Safety
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
par: Li, Lijun, et autres
Publié: (2024)
par: Li, Lijun, et autres
Publié: (2024)
GaussMark: A Practical Approach for Structural Watermarking of Language Models
par: Block, Adam, et autres
Publié: (2025)
par: Block, Adam, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
par: Dang, Trung Cuong, et autres
Publié: (2025)
par: Dang, Trung Cuong, et autres
Publié: (2025)
Large Language Models in Cybersecurity: State-of-the-Art
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
Duwak: Dual Watermarks in Large Language Models
par: Zhu, Chaoyi, et autres
Publié: (2024)
par: Zhu, Chaoyi, et autres
Publié: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
par: Bethany, Emet, et autres
Publié: (2024)
par: Bethany, Emet, et autres
Publié: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
par: Li, Xiao, et autres
Publié: (2024)
par: Li, Xiao, et autres
Publié: (2024)
LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning
par: Spracklen, Joseph, et autres
Publié: (2026)
par: Spracklen, Joseph, et autres
Publié: (2026)
Interpreting the Repeated Token Phenomenon in Large Language Models
par: Yona, Itay, et autres
Publié: (2025)
par: Yona, Itay, et autres
Publié: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
par: Zhang, Jiahao, et autres
Publié: (2024)
par: Zhang, Jiahao, et autres
Publié: (2024)
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
par: Liang, Zi, et autres
Publié: (2025)
par: Liang, Zi, et autres
Publié: (2025)
Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection
par: Liang, Zi, et autres
Publié: (2026)
par: Liang, Zi, et autres
Publié: (2026)
Lifelong Safety Alignment for Language Models
par: Wang, Haoyu, et autres
Publié: (2025)
par: Wang, Haoyu, et autres
Publié: (2025)
Documents similaires
-
FIT to Forget: Robust Continual Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2026) -
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025) -
From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning
par: Xu, Xiaoyu, et autres
Publié: (2026) -
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024) -
When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents
par: Xu, Xiaoyu, et autres
Publié: (2026)