Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Rezkellah, Fatmazohra, Dakhmouche, Ramzi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
Exploring the Robustness of In-Context Learning with Noisy Labels
di: Cheng, Chen, et al.
Pubblicazione: (2024)
di: Cheng, Chen, et al.
Pubblicazione: (2024)
The Utility and Complexity of in- and out-of-Distribution Machine Unlearning
di: Allouah, Youssef, et al.
Pubblicazione: (2024)
di: Allouah, Youssef, et al.
Pubblicazione: (2024)
Secure LLM Fine-Tuning via Safety-Aware Probing
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
di: Wu, Chengcan, et al.
Pubblicazione: (2025)
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)
Boosting Jailbreak Attack with Momentum
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning
di: Wei, Zeming, et al.
Pubblicazione: (2026)
di: Wei, Zeming, et al.
Pubblicazione: (2026)
UCD: Unlearning in LLMs via Contrastive Decoding
di: Suriyakumar, Vinith M., et al.
Pubblicazione: (2025)
di: Suriyakumar, Vinith M., et al.
Pubblicazione: (2025)
An Adversarial Perspective on Machine Unlearning for AI Safety
di: Łucki, Jakub, et al.
Pubblicazione: (2024)
di: Łucki, Jakub, et al.
Pubblicazione: (2024)
Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects
di: Li, Na, et al.
Pubblicazione: (2024)
di: Li, Na, et al.
Pubblicazione: (2024)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
Differential Privacy via Distributionally Robust Optimization
di: Selvi, Aras, et al.
Pubblicazione: (2023)
di: Selvi, Aras, et al.
Pubblicazione: (2023)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2026)
GSE: Group-wise Sparse and Explainable Adversarial Attacks
di: Sadiku, Shpresim, et al.
Pubblicazione: (2023)
di: Sadiku, Shpresim, et al.
Pubblicazione: (2023)
Efficient Optimization Algorithms for Linear Adversarial Training
di: RIbeiro, Antônio H., et al.
Pubblicazione: (2024)
di: RIbeiro, Antônio H., et al.
Pubblicazione: (2024)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods
di: Jang, Yeonwoo, et al.
Pubblicazione: (2025)
di: Jang, Yeonwoo, et al.
Pubblicazione: (2025)
Kernel Learning with Adversarial Features: Numerical Efficiency and Adaptive Regularization
di: Ribeiro, Antônio H., et al.
Pubblicazione: (2025)
di: Ribeiro, Antônio H., et al.
Pubblicazione: (2025)
k-SemStamp: A Clustering-Based Semantic Watermark for Detection of Machine-Generated Text
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
di: Hou, Abe Bohan, et al.
Pubblicazione: (2024)
SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models
di: Dabiriaghdam, Amirhossein, et al.
Pubblicazione: (2025)
di: Dabiriaghdam, Amirhossein, et al.
Pubblicazione: (2025)
Second-Order Min-Max Optimization with Lazy Hessians
di: Chen, Lesi, et al.
Pubblicazione: (2024)
di: Chen, Lesi, et al.
Pubblicazione: (2024)
SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing
di: Sun, Jialong, et al.
Pubblicazione: (2026)
di: Sun, Jialong, et al.
Pubblicazione: (2026)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions
di: Islamov, Rustem, et al.
Pubblicazione: (2026)
di: Islamov, Rustem, et al.
Pubblicazione: (2026)
Machine Unlearning Fails to Remove Data Poisoning Attacks
di: Pawelczyk, Martin, et al.
Pubblicazione: (2024)
di: Pawelczyk, Martin, et al.
Pubblicazione: (2024)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
di: Brown, Hannah, et al.
Pubblicazione: (2024)
di: Brown, Hannah, et al.
Pubblicazione: (2024)
Hidden Poison: Machine Unlearning Enables Camouflaged Poisoning Attacks
di: Di, Jimmy Z., et al.
Pubblicazione: (2022)
di: Di, Jimmy Z., et al.
Pubblicazione: (2022)
Identifying and Understanding Cross-Class Features in Adversarial Training
di: Wei, Zeming, et al.
Pubblicazione: (2025)
di: Wei, Zeming, et al.
Pubblicazione: (2025)
SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models
di: An, Bang, et al.
Pubblicazione: (2024)
di: An, Bang, et al.
Pubblicazione: (2024)
In the Name of Fairness: Assessing the Bias in Clinical Record De-identification
di: Xiao, Yuxin, et al.
Pubblicazione: (2023)
di: Xiao, Yuxin, et al.
Pubblicazione: (2023)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
Learning Fair Robustness via Domain Mixup
di: Zhong, Meiyu, et al.
Pubblicazione: (2024)
di: Zhong, Meiyu, et al.
Pubblicazione: (2024)
LLM Unlearning Should Be Form-Independent
di: Ye, Xiaotian, et al.
Pubblicazione: (2025)
di: Ye, Xiaotian, et al.
Pubblicazione: (2025)
SAEs $\textit{Can}$ Improve Unlearning: Dynamic Sparse Autoencoder Guardrails for Precision Unlearning in LLMs
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Calibrated Adversarial Sampling: Multi-Armed Bandit-Guided Generalization Against Unforeseen Attacks
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models
di: Zhang, Yihao, et al.
Pubblicazione: (2024) -
Exploring the Robustness of In-Context Learning with Noisy Labels
di: Cheng, Chen, et al.
Pubblicazione: (2024) -
The Utility and Complexity of in- and out-of-Distribution Machine Unlearning
di: Allouah, Youssef, et al.
Pubblicazione: (2024) -
Secure LLM Fine-Tuning via Safety-Aware Probing
di: Wu, Chengcan, et al.
Pubblicazione: (2025) -
Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
di: Zhang, Zhixin, et al.
Pubblicazione: (2025)