Watch the Watcher! Backdoor Attacks on Security-Enhancing Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Changjiang, Pang, Ren, Cao, Bochuan, Chen, Jinghui, Ma, Fenglong, Ji, Shouling, Wang, Ting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Your Agent Can Defend Itself against Backdoor Attacks
di: Changjiang, Li, et al.
Pubblicazione: (2025)
di: Changjiang, Li, et al.
Pubblicazione: (2025)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
Model Extraction Attacks Revisited
di: Liang, Jiacheng, et al.
Pubblicazione: (2023)
di: Liang, Jiacheng, et al.
Pubblicazione: (2023)
Data Free Backdoor Attacks
di: Cao, Bochuan, et al.
Pubblicazione: (2024)
di: Cao, Bochuan, et al.
Pubblicazione: (2024)
RAPID: Retrieval Augmented Training of Differentially Private Diffusion Models
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2025)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
Dullahan: Stealthy Backdoor Attack against Without-Label-Sharing Split Learning
di: Pu, Yuwen, et al.
Pubblicazione: (2024)
di: Pu, Yuwen, et al.
Pubblicazione: (2024)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
di: Zhang, Mingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingxuan, et al.
Pubblicazione: (2025)
On the Security Risks of ML-based Malware Detection Systems: A Survey
di: He, Ping, et al.
Pubblicazione: (2025)
di: He, Ping, et al.
Pubblicazione: (2025)
SynAT: Enhancing Security Knowledge Bases via Automatic Synthesizing Attack Tree from Crowd Discussions
di: Jiang, Ziyou, et al.
Pubblicazione: (2026)
di: Jiang, Ziyou, et al.
Pubblicazione: (2026)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
PRSA: Prompt Stealing Attacks against Real-World Prompt Services
di: Yang, Yong, et al.
Pubblicazione: (2024)
di: Yang, Yong, et al.
Pubblicazione: (2024)
Rethinking the Vulnerabilities of Face Recognition Systems:From a Practical Perspective
di: Chen, Jiahao, et al.
Pubblicazione: (2024)
di: Chen, Jiahao, et al.
Pubblicazione: (2024)
Watch Out for the Lifespan: Evaluating Backdoor Attacks Against Federated Model Adaptation
di: Vuillod, Bastien, et al.
Pubblicazione: (2025)
di: Vuillod, Bastien, et al.
Pubblicazione: (2025)
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
di: Ma, Oubo, et al.
Pubblicazione: (2025)
di: Ma, Oubo, et al.
Pubblicazione: (2025)
Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
di: Yin, Rui, et al.
Pubblicazione: (2026)
di: Yin, Rui, et al.
Pubblicazione: (2026)
Backdoor Contrastive Learning via Bi-level Trigger Optimization
di: Sun, Weiyu, et al.
Pubblicazione: (2024)
di: Sun, Weiyu, et al.
Pubblicazione: (2024)
Backdoor Attacks on Discrete Graph Diffusion Models
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
di: Wang, Jiawen, et al.
Pubblicazione: (2025)
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
di: Dai, Haoran, et al.
Pubblicazione: (2025)
di: Dai, Haoran, et al.
Pubblicazione: (2025)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
di: Zhang, Jiale, et al.
Pubblicazione: (2025)
di: Zhang, Jiale, et al.
Pubblicazione: (2025)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
Mellivora Capensis: A Backdoor-Free Training Framework on the Poisoned Dataset without Auxiliary Data
di: Pu, Yuwen, et al.
Pubblicazione: (2024)
di: Pu, Yuwen, et al.
Pubblicazione: (2024)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
Hijack Vertical Federated Learning Models As One Party
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
CAMH: Advancing Model Hijacking Attack in Machine Learning
di: He, Xing, et al.
Pubblicazione: (2024)
di: He, Xing, et al.
Pubblicazione: (2024)
Automatic Red Teaming LLM-based Agents with Model Context Protocol Tools
di: He, Ping, et al.
Pubblicazione: (2025)
di: He, Ping, et al.
Pubblicazione: (2025)
Invisible Backdoor Attacks on Diffusion Models
di: Li, Sen, et al.
Pubblicazione: (2024)
di: Li, Sen, et al.
Pubblicazione: (2024)
Breaking Isolation: A New Perspective on Hypervisor Exploitation via Cross-Domain Attacks
di: Pan, Gaoning, et al.
Pubblicazione: (2025)
di: Pan, Gaoning, et al.
Pubblicazione: (2025)
AgentWatcher: A Rule-based Prompt Injection Monitor
di: Wang, Yanting, et al.
Pubblicazione: (2026)
di: Wang, Yanting, et al.
Pubblicazione: (2026)
Are Your LLM-based Text-to-SQL Models Secure? Exploring SQL Injection via Backdoor Attacks
di: Lin, Meiyu, et al.
Pubblicazione: (2025)
di: Lin, Meiyu, et al.
Pubblicazione: (2025)
BackdoorDM: A Comprehensive Benchmark for Backdoor Learning on Diffusion Model
di: Lin, Weilin, et al.
Pubblicazione: (2025)
di: Lin, Weilin, et al.
Pubblicazione: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
di: Hossen, Md Imran, et al.
Pubblicazione: (2024)
di: Hossen, Md Imran, et al.
Pubblicazione: (2024)
Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE
di: Liu, Xinpeng, et al.
Pubblicazione: (2025)
di: Liu, Xinpeng, et al.
Pubblicazione: (2025)
Black-box Membership Inference Attacks against Fine-tuned Diffusion Models
di: Pang, Yan, et al.
Pubblicazione: (2023)
di: Pang, Yan, et al.
Pubblicazione: (2023)
Diff-Cleanse: Identifying and Mitigating Backdoor Attacks in Diffusion Models
di: Hao, Jiang, et al.
Pubblicazione: (2024)
di: Hao, Jiang, et al.
Pubblicazione: (2024)
XChainWatcher: Monitoring and Identifying Attacks in Cross-Chain Bridges
di: Augusto, André, et al.
Pubblicazione: (2024)
di: Augusto, André, et al.
Pubblicazione: (2024)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Your Agent Can Defend Itself against Backdoor Attacks
di: Changjiang, Li, et al.
Pubblicazione: (2025) -
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023) -
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
di: Cao, Bochuan, et al.
Pubblicazione: (2025) -
Model Extraction Attacks Revisited
di: Liang, Jiacheng, et al.
Pubblicazione: (2023) -
Data Free Backdoor Attacks
di: Cao, Bochuan, et al.
Pubblicazione: (2024)