AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Fengpeng, Li, Kemou, Wang, Qizhou, Han, Bo, Zhou, Jiantao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking the Vulnerability of Concept Erasure and a New Method
di: Richardson, Alex D., et al.
Pubblicazione: (2025)
di: Richardson, Alex D., et al.
Pubblicazione: (2025)
Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
di: Braun, Tobias, et al.
Pubblicazione: (2025)
di: Braun, Tobias, et al.
Pubblicazione: (2025)
VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
Low-Cost Hard-Label Adversarial Attack with Theoretical Foundations
di: Liu, Jun, et al.
Pubblicazione: (2026)
di: Liu, Jun, et al.
Pubblicazione: (2026)
AEGIS : Automated Co-Evolutionary Framework for Guarding Prompt Injections Schema
di: Liu, Ting-Chun, et al.
Pubblicazione: (2025)
di: Liu, Ting-Chun, et al.
Pubblicazione: (2025)
Generating Adversarial Point Clouds Using Diffusion Model
di: Zhao, Ruiyang, et al.
Pubblicazione: (2025)
di: Zhao, Ruiyang, et al.
Pubblicazione: (2025)
CGCE: Classifier-Guided Concept Erasure in Generative Models
di: Nguyen, Viet, et al.
Pubblicazione: (2025)
di: Nguyen, Viet, et al.
Pubblicazione: (2025)
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
di: Jia, Hengrui, et al.
Pubblicazione: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
di: Gao, Junqi, et al.
Pubblicazione: (2024)
di: Gao, Junqi, et al.
Pubblicazione: (2024)
Investigating the Impact of Quantization on Adversarial Robustness
di: Li, Qun, et al.
Pubblicazione: (2024)
di: Li, Qun, et al.
Pubblicazione: (2024)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
Are Robust LLM Fingerprints Adversarially Robust?
di: Nasery, Anshul, et al.
Pubblicazione: (2025)
di: Nasery, Anshul, et al.
Pubblicazione: (2025)
AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing
di: Fang, Sen, et al.
Pubblicazione: (2026)
di: Fang, Sen, et al.
Pubblicazione: (2026)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
di: Kang, Mintong, et al.
Pubblicazione: (2023)
di: Kang, Mintong, et al.
Pubblicazione: (2023)
Embedding Hidden Adversarial Capabilities in Pre-Trained Diffusion Models
di: Beerens, Lucas, et al.
Pubblicazione: (2025)
di: Beerens, Lucas, et al.
Pubblicazione: (2025)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
di: Lu, Junchi, et al.
Pubblicazione: (2025)
di: Lu, Junchi, et al.
Pubblicazione: (2025)
Exploring Privacy and Fairness Risks in Sharing Diffusion Models: An Adversarial Perspective
di: Luo, Xinjian, et al.
Pubblicazione: (2024)
di: Luo, Xinjian, et al.
Pubblicazione: (2024)
What's Pulling the Strings? Evaluating Integrity and Attribution in AI Training and Inference through Concept Shift
di: Chang, Jiamin, et al.
Pubblicazione: (2025)
di: Chang, Jiamin, et al.
Pubblicazione: (2025)
Neural Dehydration: Effective Erasure of Black-box Watermarks from DNNs with Limited Data
di: Lu, Yifan, et al.
Pubblicazione: (2023)
di: Lu, Yifan, et al.
Pubblicazione: (2023)
VISAT: Benchmarking Adversarial and Distribution Shift Robustness in Traffic Sign Recognition with Visual Attributes
di: Yu, Simon, et al.
Pubblicazione: (2025)
di: Yu, Simon, et al.
Pubblicazione: (2025)
On the Robustness of Bayesian Neural Networks to Adversarial Attacks
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
di: Bortolussi, Luca, et al.
Pubblicazione: (2022)
Diffusion-based Adversarial Purification for Intrusion Detection
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
di: Merzouk, Mohamed Amine, et al.
Pubblicazione: (2024)
Data-Free Privacy-Preserving for LLMs via Model Inversion and Selective Unlearning
di: Zhou, Xinjie, et al.
Pubblicazione: (2026)
di: Zhou, Xinjie, et al.
Pubblicazione: (2026)
Towards Robust Stability Prediction in Smart Grids: GAN-based Approach under Data Constraints and Adversarial Challenges
di: Efatinasab, Emad, et al.
Pubblicazione: (2025)
di: Efatinasab, Emad, et al.
Pubblicazione: (2025)
Variational Randomized Smoothing for Sample-Wise Adversarial Robustness
di: Hase, Ryo, et al.
Pubblicazione: (2024)
di: Hase, Ryo, et al.
Pubblicazione: (2024)
Adversarial Vulnerability Under Temporal Concept Drift: A Longitudinal Study of Android Malware Detection
di: Sabbah, Ahmed, et al.
Pubblicazione: (2026)
di: Sabbah, Ahmed, et al.
Pubblicazione: (2026)
Black-box Adversarial Attacks on Network-wide Multi-step Traffic State Prediction Models
di: Poudel, Bibek, et al.
Pubblicazione: (2021)
di: Poudel, Bibek, et al.
Pubblicazione: (2021)
Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers
di: Rajhans, Mona, et al.
Pubblicazione: (2026)
di: Rajhans, Mona, et al.
Pubblicazione: (2026)
Complexity Matters: Effective Dimensionality as a Measure for Adversarial Robustness
di: Khachaturov, David, et al.
Pubblicazione: (2024)
di: Khachaturov, David, et al.
Pubblicazione: (2024)
Explainable Transformer-Based Email Phishing Classification with Adversarial Robustness
di: P, Sajad U
Pubblicazione: (2025)
di: P, Sajad U
Pubblicazione: (2025)
LoRID: Low-Rank Iterative Diffusion for Adversarial Purification
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
AEGIS: Adversarial Entropy-Guided Immune System -- Thermodynamic State Space Models for Zero-Day Network Evasion Detection
di: Ferrel, Vickson
Pubblicazione: (2026)
di: Ferrel, Vickson
Pubblicazione: (2026)
MF-CLIP: Leveraging CLIP as Surrogate Models for No-box Adversarial Attacks
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
On Adversarial Robustness of Language Models in Transfer Learning
di: Turbal, Bohdan, et al.
Pubblicazione: (2024)
di: Turbal, Bohdan, et al.
Pubblicazione: (2024)
Explainer-guided Targeted Adversarial Attacks against Binary Code Similarity Detection Models
di: Chen, Mingjie, et al.
Pubblicazione: (2025)
di: Chen, Mingjie, et al.
Pubblicazione: (2025)
Adversarial Robustness in Financial Machine Learning: Defenses, Economic Impact, and Governance Evidence
di: Baviskar, Samruddhi
Pubblicazione: (2025)
di: Baviskar, Samruddhi
Pubblicazione: (2025)
Optimal Transport-Guided Adversarial Attacks on Graph Neural Network-Based Bot Detection
di: Mukherjee, Kunal, et al.
Pubblicazione: (2026)
di: Mukherjee, Kunal, et al.
Pubblicazione: (2026)
Data-Free Model-Related Attacks: Unleashing the Potential of Generative AI
di: Ye, Dayong, et al.
Pubblicazione: (2025)
di: Ye, Dayong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Rethinking the Vulnerability of Concept Erasure and a New Method
di: Richardson, Alex D., et al.
Pubblicazione: (2025) -
Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
di: Braun, Tobias, et al.
Pubblicazione: (2025) -
VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
di: Xu, Naen, et al.
Pubblicazione: (2025) -
Low-Cost Hard-Label Adversarial Attack with Theoretical Foundations
di: Liu, Jun, et al.
Pubblicazione: (2026) -
AEGIS : Automated Co-Evolutionary Framework for Guarding Prompt Injections Schema
di: Liu, Ting-Chun, et al.
Pubblicazione: (2025)