The Dual Power of Interpretable Token Embeddings: Jailbreaking Attacks and Defenses for Diffusion Model Unlearning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Siyi, Zhang, Yimeng, Liu, Sijia, Qu, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
by: Zhang, Yimeng, et al.
Published: (2024)
by: Zhang, Yimeng, et al.
Published: (2024)
To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now
by: Zhang, Yimeng, et al.
Published: (2023)
by: Zhang, Yimeng, et al.
Published: (2023)
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
by: Zhang, Yihua, et al.
Published: (2024)
by: Zhang, Yihua, et al.
Published: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
by: Guo, Yangyang, et al.
Published: (2024)
by: Guo, Yangyang, et al.
Published: (2024)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
by: Liu, Xuannan, et al.
Published: (2024)
by: Liu, Xuannan, et al.
Published: (2024)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
by: Gao, Sensen, et al.
Published: (2024)
by: Gao, Sensen, et al.
Published: (2024)
Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning
by: Liang, Siyuan, et al.
Published: (2024)
by: Liang, Siyuan, et al.
Published: (2024)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
by: Zhao, Yunhan, et al.
Published: (2025)
by: Zhao, Yunhan, et al.
Published: (2025)
Diffusion Models Learn Low-Dimensional Distributions via Subspace Clustering
by: Wang, Peng, et al.
Published: (2024)
by: Wang, Peng, et al.
Published: (2024)
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
by: Xiang, Qianlong, et al.
Published: (2026)
by: Xiang, Qianlong, et al.
Published: (2026)
Exploring Low-Dimensional Subspaces in Diffusion Models for Controllable Image Editing
by: Chen, Siyi, et al.
Published: (2024)
by: Chen, Siyi, et al.
Published: (2024)
Probing Unlearned Diffusion Models: A Transferable Adversarial Attack Perspective
by: Han, Xiaoxuan, et al.
Published: (2024)
by: Han, Xiaoxuan, et al.
Published: (2024)
Understanding Representation Dynamics of Diffusion Models via Low-Dimensional Modeling
by: Li, Xiao, et al.
Published: (2025)
by: Li, Xiao, et al.
Published: (2025)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
by: Patil, Vaidehi, et al.
Published: (2025)
by: Patil, Vaidehi, et al.
Published: (2025)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
by: Chen, Beitao, et al.
Published: (2025)
by: Chen, Beitao, et al.
Published: (2025)
A Low-Rank Defense Method for Adversarial Attack on Diffusion Models
by: Zhu, Jiaxuan, et al.
Published: (2026)
by: Zhu, Jiaxuan, et al.
Published: (2026)
Backdoor Defense in Diffusion Models via Spatial Attention Unlearning
by: Jha, Abha, et al.
Published: (2025)
by: Jha, Abha, et al.
Published: (2025)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
by: Zhu, Xingyu, et al.
Published: (2026)
by: Zhu, Xingyu, et al.
Published: (2026)
Language-Guided Diffusion Model for Visual Grounding
by: Chen, Sijia, et al.
Published: (2023)
by: Chen, Sijia, et al.
Published: (2023)
Dual-Model Defense: Safeguarding Diffusion Models from Membership Inference Attacks through Disjoint Data Splitting
by: Tran, Bao Q., et al.
Published: (2024)
by: Tran, Bao Q., et al.
Published: (2024)
Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
by: Ying, Zonghao, et al.
Published: (2026)
by: Ying, Zonghao, et al.
Published: (2026)
ID-Patch: Robust ID Association for Group Photo Personalization
by: Zhang, Yimeng, et al.
Published: (2024)
by: Zhang, Yimeng, et al.
Published: (2024)
Understanding Generalization in Diffusion Distillation via Probability Flow Distance
by: Zhang, Huijie, et al.
Published: (2025)
by: Zhang, Huijie, et al.
Published: (2025)
Dual-View Inference Attack: Machine Unlearning Amplifies Privacy Exposure
by: Xue, Lulu, et al.
Published: (2025)
by: Xue, Lulu, et al.
Published: (2025)
Projected Gradient Unlearning for Text-to-Image Diffusion Models: Defending Against Concept Revival Attacks
by: Aladawi, Aljalila, et al.
Published: (2026)
by: Aladawi, Aljalila, et al.
Published: (2026)
A Dual-Purpose Framework for Backdoor Defense and Backdoor Amplification in Diffusion Models
by: Truong, Vu Tuan, et al.
Published: (2025)
by: Truong, Vu Tuan, et al.
Published: (2025)
Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification
by: Zhou, Yuhang, et al.
Published: (2025)
by: Zhou, Yuhang, et al.
Published: (2025)
Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
by: Li, Yize, et al.
Published: (2024)
by: Li, Yize, et al.
Published: (2024)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
by: Jia, Xiaojun, et al.
Published: (2025)
by: Jia, Xiaojun, et al.
Published: (2025)
Unfolding Videos Dynamics via Taylor Expansion
by: Chen, Siyi, et al.
Published: (2024)
by: Chen, Siyi, et al.
Published: (2024)
Why Instruction-Based Unlearning Fails in Diffusion Models?
by: Zhang, Zeliang, et al.
Published: (2026)
by: Zhang, Zeliang, et al.
Published: (2026)
LAPTOP-Diff: Layer Pruning and Normalized Distillation for Compressing Diffusion Models
by: Zhang, Dingkun, et al.
Published: (2024)
by: Zhang, Dingkun, et al.
Published: (2024)
Attack for Defense: Adversarial Agents for Point Prompt Optimization Empowering Segment Anything Model
by: Liu, Xueyu, et al.
Published: (2025)
by: Liu, Xueyu, et al.
Published: (2025)
Concept Unlearning by Modeling Key Steps of Diffusion Process
by: Zhang, Chaoshuo, et al.
Published: (2025)
by: Zhang, Chaoshuo, et al.
Published: (2025)
FPAN: Mitigating Replication in Diffusion Models through the Fine-Grained Probabilistic Addition of Noise to Token Embeddings
by: Xu, Jingqi, et al.
Published: (2025)
by: Xu, Jingqi, et al.
Published: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
by: Jiang, Lei, et al.
Published: (2025)
by: Jiang, Lei, et al.
Published: (2025)
BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning
by: Liang, Siyuan, et al.
Published: (2023)
by: Liang, Siyuan, et al.
Published: (2023)
A Dataset and Benchmark for Copyright Infringement Unlearning from Text-to-Image Diffusion Models
by: Ma, Rui, et al.
Published: (2024)
by: Ma, Rui, et al.
Published: (2024)
Proxy-Embedding as an Adversarial Teacher: An Embedding-Guided Bidirectional Attack for Referring Expression Segmentation Models
by: Chen, Xingbai, et al.
Published: (2025)
by: Chen, Xingbai, et al.
Published: (2025)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
by: Ge, Yuying, et al.
Published: (2024)
by: Ge, Yuying, et al.
Published: (2024)
Similar Items
-
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
by: Zhang, Yimeng, et al.
Published: (2024) -
To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now
by: Zhang, Yimeng, et al.
Published: (2023) -
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
by: Zhang, Yihua, et al.
Published: (2024) -
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
by: Guo, Yangyang, et al.
Published: (2024) -
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
by: Liu, Xuannan, et al.
Published: (2024)