Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise Consistency
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Bingzheng, Gu, Xiaoyan, Xu, Hongbo, Li, Hongcheng, Yu, Zimo, Zhou, Jiang, Wang, Weiping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
di: Chen, Linzhi, et al.
Pubblicazione: (2025)
di: Chen, Linzhi, et al.
Pubblicazione: (2025)
Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models
di: Yu, Miao, et al.
Pubblicazione: (2025)
di: Yu, Miao, et al.
Pubblicazione: (2025)
BackdoorMBTI: A Backdoor Learning Multimodal Benchmark Tool Kit for Backdoor Defense Evaluation
di: Yu, Haiyang, et al.
Pubblicazione: (2024)
di: Yu, Haiyang, et al.
Pubblicazione: (2024)
Lightweight and Fast Backdoor Model Detection
di: Yu, Yinbo, et al.
Pubblicazione: (2026)
di: Yu, Yinbo, et al.
Pubblicazione: (2026)
DeBackdoor: A Deductive Framework for Detecting Backdoor Attacks on Deep Models with Limited Data
di: Popovic, Dorde, et al.
Pubblicazione: (2025)
di: Popovic, Dorde, et al.
Pubblicazione: (2025)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
BackdoorDM: A Comprehensive Benchmark for Backdoor Learning on Diffusion Model
di: Lin, Weilin, et al.
Pubblicazione: (2025)
di: Lin, Weilin, et al.
Pubblicazione: (2025)
Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs
di: Li, Yige, et al.
Pubblicazione: (2026)
di: Li, Yige, et al.
Pubblicazione: (2026)
Backdoor Samples Detection Based on Perturbation Discrepancy Consistency in Pre-trained Language Models
di: Peng, Zuquan, et al.
Pubblicazione: (2025)
di: Peng, Zuquan, et al.
Pubblicazione: (2025)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
di: Li, Yige, et al.
Pubblicazione: (2025)
di: Li, Yige, et al.
Pubblicazione: (2025)
When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations
di: Ge, Huaizhi, et al.
Pubblicazione: (2024)
di: Ge, Huaizhi, et al.
Pubblicazione: (2024)
Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
di: Chen, Tianxin, et al.
Pubblicazione: (2026)
di: Chen, Tianxin, et al.
Pubblicazione: (2026)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
di: Li, Xi, et al.
Pubblicazione: (2024)
di: Li, Xi, et al.
Pubblicazione: (2024)
Elijah: Eliminating Backdoors Injected in Diffusion Models via Distribution Shift
di: An, Shengwei, et al.
Pubblicazione: (2023)
di: An, Shengwei, et al.
Pubblicazione: (2023)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Evolutionary Trigger Detection and Lightweight Model Repair Based Backdoor Defense
di: Zhou, Qi, et al.
Pubblicazione: (2024)
di: Zhou, Qi, et al.
Pubblicazione: (2024)
CatchBackdoor: Backdoor Detection via Critical Trojan Neural Path Fuzzing
di: Jin, Haibo, et al.
Pubblicazione: (2021)
di: Jin, Haibo, et al.
Pubblicazione: (2021)
Towards Backdoor Stealthiness in Model Parameter Space
di: Xu, Xiaoyun, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyun, et al.
Pubblicazione: (2025)
BAN: Detecting Backdoors Activated by Adversarial Neuron Noise
di: Xu, Xiaoyun, et al.
Pubblicazione: (2024)
di: Xu, Xiaoyun, et al.
Pubblicazione: (2024)
PSBD: Prediction Shift Uncertainty Unlocks Backdoor Detection
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Injection, Attack and Erasure: Revocable Backdoor Attacks via Machine Unlearning
di: Song, Baogang, et al.
Pubblicazione: (2025)
di: Song, Baogang, et al.
Pubblicazione: (2025)
Beyond Immediate Activation: Temporally Decoupled Backdoor Attacks on Time Series Forecasting
di: Liu, Zhixin, et al.
Pubblicazione: (2026)
di: Liu, Zhixin, et al.
Pubblicazione: (2026)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
Concept-Guided Backdoor Attack on Vision Language Models
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
Impart: An Imperceptible and Effective Label-Specific Backdoor Attack
di: Zhao, Jingke, et al.
Pubblicazione: (2024)
di: Zhao, Jingke, et al.
Pubblicazione: (2024)
Backdooring Bias in Large Language Models
di: Das, Anudeep, et al.
Pubblicazione: (2026)
di: Das, Anudeep, et al.
Pubblicazione: (2026)
Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models
di: Ding, Zikang, et al.
Pubblicazione: (2026)
di: Ding, Zikang, et al.
Pubblicazione: (2026)
Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection
di: Li, Wenjie, et al.
Pubblicazione: (2025)
di: Li, Wenjie, et al.
Pubblicazione: (2025)
TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
Flashy Backdoor: Real-world Environment Backdoor Attack on SNNs with DVS Cameras
di: Riaño, Roberto, et al.
Pubblicazione: (2024)
di: Riaño, Roberto, et al.
Pubblicazione: (2024)
Fast and Lightweight Backdoor Detection via Head Random Probing
di: Yu, Yinbo, et al.
Pubblicazione: (2026)
di: Yu, Yinbo, et al.
Pubblicazione: (2026)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
OCGEC: One-class Graph Embedding Classification for DNN Backdoor Detection
di: Jiang, Haoyu, et al.
Pubblicazione: (2023)
di: Jiang, Haoyu, et al.
Pubblicazione: (2023)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
Backdooring Bias ($B^2$) into Stable Diffusion Models
di: Naseh, Ali, et al.
Pubblicazione: (2024)
di: Naseh, Ali, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attack to Real-world Models in Android Apps
di: Wei, Jiali, et al.
Pubblicazione: (2025)
di: Wei, Jiali, et al.
Pubblicazione: (2025)
Backdooring Masked Diffusion Language Models
di: Cao, Daniel Yiming, et al.
Pubblicazione: (2026)
di: Cao, Daniel Yiming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
di: Chen, Linzhi, et al.
Pubblicazione: (2025) -
Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models
di: Yu, Miao, et al.
Pubblicazione: (2025) -
BackdoorMBTI: A Backdoor Learning Multimodal Benchmark Tool Kit for Backdoor Defense Evaluation
di: Yu, Haiyang, et al.
Pubblicazione: (2024) -
Lightweight and Fast Backdoor Model Detection
di: Yu, Yinbo, et al.
Pubblicazione: (2026) -
DeBackdoor: A Deductive Framework for Detecting Backdoor Attacks on Deep Models with Limited Data
di: Popovic, Dorde, et al.
Pubblicazione: (2025)