TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
Fuente:
arXiv
Guardado en:
| Autores principales: | Mo, Yichuan, Huang, Hui, Li, Mingjie, Li, Ang, Wang, Yisen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
por: Li, Ang, et al.
Publicado: (2024)
por: Li, Ang, et al.
Publicado: (2024)
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
por: Wang, Yisen, et al.
Publicado: (2025)
por: Wang, Yisen, et al.
Publicado: (2025)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023)
por: Wei, Zeming, et al.
Publicado: (2023)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
MADE: Graph Backdoor Defense with Masked Unlearning
por: Lin, Xiao, et al.
Publicado: (2024)
por: Lin, Xiao, et al.
Publicado: (2024)
How to Craft Backdoors with Unlabeled Data Alone?
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
por: Lu, Junchi, et al.
Publicado: (2025)
por: Lu, Junchi, et al.
Publicado: (2025)
Backdooring Bias ($B^2$) into Stable Diffusion Models
por: Naseh, Ali, et al.
Publicado: (2024)
por: Naseh, Ali, et al.
Publicado: (2024)
GuardReasoner: Towards Reasoning-based LLM Safeguards
por: Liu, Yue, et al.
Publicado: (2025)
por: Liu, Yue, et al.
Publicado: (2025)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
por: Huang, Yuanmin, et al.
Publicado: (2025)
por: Huang, Yuanmin, et al.
Publicado: (2025)
Elijah: Eliminating Backdoors Injected in Diffusion Models via Distribution Shift
por: An, Shengwei, et al.
Publicado: (2023)
por: An, Shengwei, et al.
Publicado: (2023)
TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems
por: Wang, Kai, et al.
Publicado: (2026)
por: Wang, Kai, et al.
Publicado: (2026)
Backdoor Graph Condensation
por: Wu, Jiahao, et al.
Publicado: (2024)
por: Wu, Jiahao, et al.
Publicado: (2024)
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
por: Ma, Oubo, et al.
Publicado: (2025)
por: Ma, Oubo, et al.
Publicado: (2025)
Heterogeneous Graph Backdoor Attack
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
PSBD: Prediction Shift Uncertainty Unlocks Backdoor Detection
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
por: Shin, Jeongjin, et al.
Publicado: (2024)
por: Shin, Jeongjin, et al.
Publicado: (2024)
Graph Neural Backdoor: Fundamentals, Methodologies, Applications, and Future Directions
por: Yang, Xiao, et al.
Publicado: (2024)
por: Yang, Xiao, et al.
Publicado: (2024)
Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
por: Wang, Yifei, et al.
Publicado: (2026)
por: Wang, Yifei, et al.
Publicado: (2026)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
por: Jiang, Yukun, et al.
Publicado: (2026)
por: Jiang, Yukun, et al.
Publicado: (2026)
Rethinking Pruning for Backdoor Mitigation: An Optimization Perspective
por: Li, Nan, et al.
Publicado: (2024)
por: Li, Nan, et al.
Publicado: (2024)
Magnitude-based Neuron Pruning for Backdoor Defens
por: Li, Nan, et al.
Publicado: (2024)
por: Li, Nan, et al.
Publicado: (2024)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Rounding-Guided Backdoor Injection in Deep Learning Model Quantization
por: Chen, Xiangxiang, et al.
Publicado: (2025)
por: Chen, Xiangxiang, et al.
Publicado: (2025)
Your Agent Can Defend Itself against Backdoor Attacks
por: Changjiang, Li, et al.
Publicado: (2025)
por: Changjiang, Li, et al.
Publicado: (2025)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
por: Pal, Soumyadeep, et al.
Publicado: (2024)
por: Pal, Soumyadeep, et al.
Publicado: (2024)
PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation
por: Yan, Bingyu, et al.
Publicado: (2026)
por: Yan, Bingyu, et al.
Publicado: (2026)
Compromising Embodied Agents with Contextual Backdoor Attacks
por: Liu, Aishan, et al.
Publicado: (2024)
por: Liu, Aishan, et al.
Publicado: (2024)
Safeguarding Text-to-Image Generative Models Against Unauthorized Knowledge Distillation
por: Gao, Yilan, et al.
Publicado: (2026)
por: Gao, Yilan, et al.
Publicado: (2026)
GenoArmory: A Unified Evaluation Framework for Adversarial Attacks on Genomic Foundation Models
por: Luo, Haozheng, et al.
Publicado: (2025)
por: Luo, Haozheng, et al.
Publicado: (2025)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
por: Min, Rui, et al.
Publicado: (2024)
por: Min, Rui, et al.
Publicado: (2024)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
por: Gong, Chen, et al.
Publicado: (2022)
por: Gong, Chen, et al.
Publicado: (2022)
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
por: Li, Jianwei, et al.
Publicado: (2026)
por: Li, Jianwei, et al.
Publicado: (2026)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
por: Pawlak, Stanisław, et al.
Publicado: (2025)
por: Pawlak, Stanisław, et al.
Publicado: (2025)
OCGEC: One-class Graph Embedding Classification for DNN Backdoor Detection
por: Jiang, Haoyu, et al.
Publicado: (2023)
por: Jiang, Haoyu, et al.
Publicado: (2023)
A Unified Framework for LLM Watermarks
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning
por: Zhang, Jiawei, et al.
Publicado: (2025)
por: Zhang, Jiawei, et al.
Publicado: (2025)
Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation
por: Li, Jianwei, et al.
Publicado: (2026)
por: Li, Jianwei, et al.
Publicado: (2026)
Mutual Information Guided Backdoor Mitigation for Pre-trained Encoders
por: Han, Tingxu, et al.
Publicado: (2024)
por: Han, Tingxu, et al.
Publicado: (2024)
Ejemplares similares
-
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
por: Li, Ang, et al.
Publicado: (2024) -
Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
por: Wang, Yisen, et al.
Publicado: (2025) -
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023) -
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024) -
MADE: Graph Backdoor Defense with Masked Unlearning
por: Lin, Xiao, et al.
Publicado: (2024)