Sparse Autoencoder as a Zero-Shot Classifier for Concept Erasing in Text-to-Image Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tian, Zhihua, Nan, Sirun, Xu, Ming, Zhai, Shengfang, Qu, Wenjie, Liu, Jian, Jia, Ruoxi, Zhang, Jiaheng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation
by: Zhai, Shengfang, et al.
Published: (2025)
by: Zhai, Shengfang, et al.
Published: (2025)
Securing LLM Agents Need Intent-to-Execution Integrity
by: Qu, Wenjie, et al.
Published: (2026)
by: Qu, Wenjie, et al.
Published: (2026)
Provably Robust Multi-bit Watermarking for AI-generated Text
by: Qu, Wenjie, et al.
Published: (2024)
by: Qu, Wenjie, et al.
Published: (2024)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
by: Wu, Linyu, et al.
Published: (2025)
by: Wu, Linyu, et al.
Published: (2025)
Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
BadDLM: Backdooring Diffusion Language Models with Diverse Targets
by: Zhai, Shengfang, et al.
Published: (2026)
by: Zhai, Shengfang, et al.
Published: (2026)
IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation
by: Guo, Yanpei, et al.
Published: (2026)
by: Guo, Yanpei, et al.
Published: (2026)
Discovering Universal Semantic Triggers for Text-to-Image Synthesis
by: Zhai, Shengfang, et al.
Published: (2024)
by: Zhai, Shengfang, et al.
Published: (2024)
Erasing Radio Frequency Fingerprints via Active Adversarial Perturbation
by: Lu, Zhaoyi, et al.
Published: (2024)
by: Lu, Zhaoyi, et al.
Published: (2024)
Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
by: Zhai, Shengfang, et al.
Published: (2024)
by: Zhai, Shengfang, et al.
Published: (2024)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
by: Zhao, Shiqian, et al.
Published: (2025)
by: Zhao, Shiqian, et al.
Published: (2025)
Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
by: Zhu, Zhenhao, et al.
Published: (2026)
by: Zhu, Zhenhao, et al.
Published: (2026)
MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots
by: Wang, Yuhao, et al.
Published: (2026)
by: Wang, Yuhao, et al.
Published: (2026)
Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
by: Das, Anudeep, et al.
Published: (2025)
by: Das, Anudeep, et al.
Published: (2025)
Erased but Not Forgotten: How Backdoors Compromise Concept Erasure
by: Braun, Tobias, et al.
Published: (2025)
by: Braun, Tobias, et al.
Published: (2025)
Prompt Inversion Attack against Collaborative Inference of Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Purify Once, Edit Freely: Breaking Image Protections under Model Mismatch
by: Zhao, Qichen, et al.
Published: (2026)
by: Zhao, Qichen, et al.
Published: (2026)
Self-Sovereign Agent
by: Qu, Wenjie, et al.
Published: (2026)
by: Qu, Wenjie, et al.
Published: (2026)
RepoMark: A Data-Usage Auditing Framework for Code Large Language Models
by: Qu, Wenjie, et al.
Published: (2025)
by: Qu, Wenjie, et al.
Published: (2025)
Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models
by: Wang, Kai, et al.
Published: (2026)
by: Wang, Kai, et al.
Published: (2026)
METANOIA: A Lifelong Intrusion Detection and Investigation System for Mitigating Concept Drift
by: Ying, Jie, et al.
Published: (2024)
by: Ying, Jie, et al.
Published: (2024)
Memory-Induced Tool-Drift in LLM Agents
by: Dabas, Mahavir, et al.
Published: (2026)
by: Dabas, Mahavir, et al.
Published: (2026)
Robustness of Watermarking on Text-to-Image Diffusion Models
by: Wu, Xiaodong, et al.
Published: (2024)
by: Wu, Xiaodong, et al.
Published: (2024)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
by: Huo, Jiahao, et al.
Published: (2026)
by: Huo, Jiahao, et al.
Published: (2026)
Attacks on Approximate Caches in Text-to-Image Diffusion Models
by: Sun, Desen, et al.
Published: (2025)
by: Sun, Desen, et al.
Published: (2025)
LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models
by: Wang, Yaopeng, et al.
Published: (2026)
by: Wang, Yaopeng, et al.
Published: (2026)
Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
by: Shi, Zhuan, et al.
Published: (2026)
by: Shi, Zhuan, et al.
Published: (2026)
Fast, Secure, and High-Capacity Image Watermarking with Autoencoded Text Vectors
by: Evennou, Gautier, et al.
Published: (2025)
by: Evennou, Gautier, et al.
Published: (2025)
Detecting Zero-Day Web Attacks with an Ensemble of LSTM, GRU, and Stacked Autoencoders
by: Babaey, Vahid, et al.
Published: (2025)
by: Babaey, Vahid, et al.
Published: (2025)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
by: Zhao, Mengnan, et al.
Published: (2026)
by: Zhao, Mengnan, et al.
Published: (2026)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
by: Liu, Yue, et al.
Published: (2025)
by: Liu, Yue, et al.
Published: (2025)
Dual-Guard: Dual-Channel Latent Watermarking for Provenance and Tamper Localization in Diffusion Images
by: Xie, JinFeng, et al.
Published: (2026)
by: Xie, JinFeng, et al.
Published: (2026)
Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models
by: Cretu, Ana-Maria, et al.
Published: (2025)
by: Cretu, Ana-Maria, et al.
Published: (2025)
Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought
by: Lu, Jiacheng, et al.
Published: (2026)
by: Lu, Jiacheng, et al.
Published: (2026)
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
by: Dai, Haoran, et al.
Published: (2025)
by: Dai, Haoran, et al.
Published: (2025)
DEFENDCLI: {Command-Line} Driven Attack Provenance Examination
by: Wu, Peilun, et al.
Published: (2025)
by: Wu, Peilun, et al.
Published: (2025)
VAEMax: Open-Set Intrusion Detection based on OpenMax and Variational Autoencoder
by: Qiu, Zhiyin, et al.
Published: (2024)
by: Qiu, Zhiyin, et al.
Published: (2024)
A Comprehensive Study on GDPR-Oriented Analysis of Privacy Policies: Taxonomy, Corpus and GDPR Concept Classifiers
by: Tang, Peng, et al.
Published: (2024)
by: Tang, Peng, et al.
Published: (2024)
Life-Cycle Routing Vulnerabilities of LLM Router
by: Lin, Qiqi, et al.
Published: (2025)
by: Lin, Qiqi, et al.
Published: (2025)
Similar Items
-
Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation
by: Zhai, Shengfang, et al.
Published: (2025) -
Securing LLM Agents Need Intent-to-Execution Integrity
by: Qu, Wenjie, et al.
Published: (2026) -
Provably Robust Multi-bit Watermarking for AI-generated Text
by: Qu, Wenjie, et al.
Published: (2024) -
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
by: Wu, Linyu, et al.
Published: (2025) -
Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries
by: Wang, Yuhao, et al.
Published: (2025)