Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rezkellah, Fatmazohra, Dakhmouche, Ramzi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
Exploring the Robustness of In-Context Learning with Noisy Labels
par: Cheng, Chen, et autres
Publié: (2024)
par: Cheng, Chen, et autres
Publié: (2024)
The Utility and Complexity of in- and out-of-Distribution Machine Unlearning
par: Allouah, Youssef, et autres
Publié: (2024)
par: Allouah, Youssef, et autres
Publié: (2024)
Secure LLM Fine-Tuning via Safety-Aware Probing
par: Wu, Chengcan, et autres
Publié: (2025)
par: Wu, Chengcan, et autres
Publié: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
par: Zhang, Zhixin, et autres
Publié: (2025)
par: Zhang, Zhixin, et autres
Publié: (2025)
Boosting Jailbreak Attack with Momentum
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
par: Wei, Zeming, et autres
Publié: (2026)
par: Wei, Zeming, et autres
Publié: (2026)
UCD: Unlearning in LLMs via Contrastive Decoding
par: Suriyakumar, Vinith M., et autres
Publié: (2025)
par: Suriyakumar, Vinith M., et autres
Publié: (2025)
An Adversarial Perspective on Machine Unlearning for AI Safety
par: Łucki, Jakub, et autres
Publié: (2024)
par: Łucki, Jakub, et autres
Publié: (2024)
Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects
par: Li, Na, et autres
Publié: (2024)
par: Li, Na, et autres
Publié: (2024)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Differential Privacy via Distributionally Robust Optimization
par: Selvi, Aras, et autres
Publié: (2023)
par: Selvi, Aras, et autres
Publié: (2023)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
par: Chen, Yen-Shan, et autres
Publié: (2026)
par: Chen, Yen-Shan, et autres
Publié: (2026)
GSE: Group-wise Sparse and Explainable Adversarial Attacks
par: Sadiku, Shpresim, et autres
Publié: (2023)
par: Sadiku, Shpresim, et autres
Publié: (2023)
Efficient Optimization Algorithms for Linear Adversarial Training
par: RIbeiro, Antônio H., et autres
Publié: (2024)
par: RIbeiro, Antônio H., et autres
Publié: (2024)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
par: Li, Nathaniel, et autres
Publié: (2024)
par: Li, Nathaniel, et autres
Publié: (2024)
Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods
par: Jang, Yeonwoo, et autres
Publié: (2025)
par: Jang, Yeonwoo, et autres
Publié: (2025)
Kernel Learning with Adversarial Features: Numerical Efficiency and Adaptive Regularization
par: Ribeiro, Antônio H., et autres
Publié: (2025)
par: Ribeiro, Antônio H., et autres
Publié: (2025)
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models
par: Dabiriaghdam, Amirhossein, et autres
Publié: (2025)
par: Dabiriaghdam, Amirhossein, et autres
Publié: (2025)
Second-Order Min-Max Optimization with Lazy Hessians
par: Chen, Lesi, et autres
Publié: (2024)
par: Chen, Lesi, et autres
Publié: (2024)
SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing
par: Sun, Jialong, et autres
Publié: (2026)
par: Sun, Jialong, et autres
Publié: (2026)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
par: Xu, Xiaoyu, et autres
Publié: (2025)
par: Xu, Xiaoyu, et autres
Publié: (2025)
Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions
par: Islamov, Rustem, et autres
Publié: (2026)
par: Islamov, Rustem, et autres
Publié: (2026)
Machine Unlearning Fails to Remove Data Poisoning Attacks
par: Pawelczyk, Martin, et autres
Publié: (2024)
par: Pawelczyk, Martin, et autres
Publié: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)
par: Brown, Hannah, et autres
Publié: (2024)
Hidden Poison: Machine Unlearning Enables Camouflaged Poisoning Attacks
par: Di, Jimmy Z., et autres
Publié: (2022)
par: Di, Jimmy Z., et autres
Publié: (2022)
Identifying and Understanding Cross-Class Features in Adversarial Training
par: Wei, Zeming, et autres
Publié: (2025)
par: Wei, Zeming, et autres
Publié: (2025)
SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models
par: Djuhera, Aladin, et autres
Publié: (2025)
par: Djuhera, Aladin, et autres
Publié: (2025)
BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers
par: Xue, Jiaqi, et autres
Publié: (2024)
par: Xue, Jiaqi, et autres
Publié: (2024)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
par: An, Bang, et autres
Publié: (2024)
par: An, Bang, et autres
Publié: (2024)
In the Name of Fairness: Assessing the Bias in Clinical Record De-identification
par: Xiao, Yuxin, et autres
Publié: (2023)
par: Xiao, Yuxin, et autres
Publié: (2023)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Learning Fair Robustness via Domain Mixup
par: Zhong, Meiyu, et autres
Publié: (2024)
par: Zhong, Meiyu, et autres
Publié: (2024)
LLM Unlearning Should Be Form-Independent
par: Ye, Xiaotian, et autres
Publié: (2025)
par: Ye, Xiaotian, et autres
Publié: (2025)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
par: Kaneko, Masahiro, et autres
Publié: (2025)
par: Kaneko, Masahiro, et autres
Publié: (2025)
Calibrated Adversarial Sampling: Multi-Armed Bandit-Guided Generalization Against Unforeseen Attacks
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
Documents similaires
-
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
par: Zhang, Yihao, et autres
Publié: (2024) -
Exploring the Robustness of In-Context Learning with Noisy Labels
par: Cheng, Chen, et autres
Publié: (2024) -
The Utility and Complexity of in- and out-of-Distribution Machine Unlearning
par: Allouah, Youssef, et autres
Publié: (2024) -
Secure LLM Fine-Tuning via Safety-Aware Probing
par: Wu, Chengcan, et autres
Publié: (2025) -
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
par: Zhang, Zhixin, et autres
Publié: (2025)