What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers
Fuente:
arXiv
Saved in:
| Main Author: | Zhang, Chenyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale
by: Yuan, Xiaoyong, et al.
Published: (2025)
by: Yuan, Xiaoyong, et al.
Published: (2025)
Detecting Malicious Concepts without Image Generation in AI-Generated Content (AIGC)
by: Xu, Kun, et al.
Published: (2025)
by: Xu, Kun, et al.
Published: (2025)
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
by: Zhang, Chenyu, et al.
Published: (2025)
by: Zhang, Chenyu, et al.
Published: (2025)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
by: Yin, Qinghong, et al.
Published: (2025)
by: Yin, Qinghong, et al.
Published: (2025)
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
by: Zhang, Yimeng, et al.
Published: (2024)
by: Zhang, Yimeng, et al.
Published: (2024)
Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
by: Shi, Zhuan, et al.
Published: (2026)
by: Shi, Zhuan, et al.
Published: (2026)
Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
by: Ren, Jie, et al.
Published: (2024)
by: Ren, Jie, et al.
Published: (2024)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
by: Lai, Songning, et al.
Published: (2024)
by: Lai, Songning, et al.
Published: (2024)
Adversarial Attacks and Defenses on Text-to-Image Diffusion Models: A Survey
by: Zhang, Chenyu, et al.
Published: (2024)
by: Zhang, Chenyu, et al.
Published: (2024)
CAT: Concept-level backdoor ATtacks for Concept Bottleneck Models
by: Lai, Songning, et al.
Published: (2024)
by: Lai, Songning, et al.
Published: (2024)
Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
by: Das, Anudeep, et al.
Published: (2025)
by: Das, Anudeep, et al.
Published: (2025)
Espresso: Robust Concept Filtering in Text-to-Image Models
by: Das, Anudeep, et al.
Published: (2024)
by: Das, Anudeep, et al.
Published: (2024)
TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
by: Zhang, Chaoshuo, et al.
Published: (2026)
by: Zhang, Chaoshuo, et al.
Published: (2026)
Backdooring CLIP through Concept Confusion
by: Hu, Lijie, et al.
Published: (2025)
by: Hu, Lijie, et al.
Published: (2025)
VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
by: Xu, Naen, et al.
Published: (2025)
by: Xu, Naen, et al.
Published: (2025)
Can You Trust What You See? Alpha Channel No-Box Attacks on Video Object Detection
by: Yi, Ariana, et al.
Published: (2025)
by: Yi, Ariana, et al.
Published: (2025)
ViTGuard: Attention-aware Detection against Adversarial Examples for Vision Transformer
by: Sun, Shihua, et al.
Published: (2024)
by: Sun, Shihua, et al.
Published: (2024)
LoyalDiffusion: A Diffusion Model Guarding Against Data Replication
by: Li, Chenghao, et al.
Published: (2024)
by: Li, Chenghao, et al.
Published: (2024)
DeeCLIP: A Robust and Generalizable Transformer-Based Framework for Detecting AI-Generated Images
by: Keita, Mamadou, et al.
Published: (2025)
by: Keita, Mamadou, et al.
Published: (2025)
Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models
by: Suriyakumar, Vinith M., et al.
Published: (2024)
by: Suriyakumar, Vinith M., et al.
Published: (2024)
Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents
by: Ma, Bo, et al.
Published: (2026)
by: Ma, Bo, et al.
Published: (2026)
Controllable Adversarial Makeup for Privacy via Text-Guided Diffusion
by: Kwon, Youngjin, et al.
Published: (2025)
by: Kwon, Youngjin, et al.
Published: (2025)
Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration
by: Li, Jun, et al.
Published: (2026)
by: Li, Jun, et al.
Published: (2026)
Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
by: Li, Zida, et al.
Published: (2026)
by: Li, Zida, et al.
Published: (2026)
Semantic Deep Hiding for Robust Unlearnable Examples
by: Meng, Ruohan, et al.
Published: (2024)
by: Meng, Ruohan, et al.
Published: (2024)
Sparse Autoencoder as a Zero-Shot Classifier for Concept Erasing in Text-to-Image Diffusion Models
by: Tian, Zhihua, et al.
Published: (2025)
by: Tian, Zhihua, et al.
Published: (2025)
MMA-Diffusion: MultiModal Attack on Diffusion Models
by: Yang, Yijun, et al.
Published: (2023)
by: Yang, Yijun, et al.
Published: (2023)
Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations
by: Liu, Haitong, et al.
Published: (2025)
by: Liu, Haitong, et al.
Published: (2025)
An Inversion-based Measure of Memorization for Diffusion Models
by: Ma, Zhe, et al.
Published: (2024)
by: Ma, Zhe, et al.
Published: (2024)
FreqCross: A Multi-Modal Frequency-Spatial Fusion Network for Robust Detection of Stable Diffusion 3.5 Generated Images
by: Yang, Guang
Published: (2025)
by: Yang, Guang
Published: (2025)
Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models
by: Zhang, Lei, et al.
Published: (2025)
by: Zhang, Lei, et al.
Published: (2025)
Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
by: Wei, Kang, et al.
Published: (2025)
by: Wei, Kang, et al.
Published: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
by: Su, Yanghao, et al.
Published: (2024)
by: Su, Yanghao, et al.
Published: (2024)
Mitigate Replication and Copying in Diffusion Models with Generalized Caption and Dual Fusion Enhancement
by: Li, Chenghao, et al.
Published: (2023)
by: Li, Chenghao, et al.
Published: (2023)
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models
by: Yang, Zijin, et al.
Published: (2024)
by: Yang, Zijin, et al.
Published: (2024)
NeR-VCP: A Video Content Protection Method Based on Implicit Neural Representation
by: Lin, Yangping, et al.
Published: (2024)
by: Lin, Yangping, et al.
Published: (2024)
Is Diffusion Model Safe? Severe Data Leakage via Gradient-Guided Diffusion Model
by: Meng, Jiayang, et al.
Published: (2024)
by: Meng, Jiayang, et al.
Published: (2024)
Similar Items
-
What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale
by: Yuan, Xiaoyong, et al.
Published: (2025) -
Detecting Malicious Concepts without Image Generation in AI-Generated Content (AIGC)
by: Xu, Kun, et al.
Published: (2025) -
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
by: Zhang, Chenyu, et al.
Published: (2025) -
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
by: Yin, Qinghong, et al.
Published: (2025) -
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
by: Zhang, Yimeng, et al.
Published: (2024)