Espresso: Robust Concept Filtering in Text-to-Image Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Das, Anudeep, Duddu, Vasisht, Zhang, Rui, Asokan, N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
di: Das, Anudeep, et al.
Pubblicazione: (2025)
di: Das, Anudeep, et al.
Pubblicazione: (2025)
Locket: Robust Feature-Locking Technique for Language Models
di: He, Lipeng, et al.
Pubblicazione: (2025)
di: He, Lipeng, et al.
Pubblicazione: (2025)
Combining Machine Learning Defenses without Conflicts
di: Duddu, Vasisht, et al.
Pubblicazione: (2024)
di: Duddu, Vasisht, et al.
Pubblicazione: (2024)
Attesting Distributional Properties of Training Data for Machine Learning
di: Duddu, Vasisht, et al.
Pubblicazione: (2023)
di: Duddu, Vasisht, et al.
Pubblicazione: (2023)
TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
di: Zhang, Chaoshuo, et al.
Pubblicazione: (2026)
di: Zhang, Chaoshuo, et al.
Pubblicazione: (2026)
SoK: Unintended Interactions among Machine Learning Defenses and Risks
di: Duddu, Vasisht, et al.
Pubblicazione: (2023)
di: Duddu, Vasisht, et al.
Pubblicazione: (2023)
Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
di: Shi, Zhuan, et al.
Pubblicazione: (2026)
di: Shi, Zhuan, et al.
Pubblicazione: (2026)
SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution
di: Ba, Zhongjie, et al.
Pubblicazione: (2023)
di: Ba, Zhongjie, et al.
Pubblicazione: (2023)
Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration
di: Li, Jun, et al.
Pubblicazione: (2026)
di: Li, Jun, et al.
Pubblicazione: (2026)
PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
di: Hughes, Anthony, et al.
Pubblicazione: (2025)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
di: Yin, Qinghong, et al.
Pubblicazione: (2025)
Defensive Unlearning with Adversarial Training for Robust Concept Erasure in Diffusion Models
di: Zhang, Yimeng, et al.
Pubblicazione: (2024)
di: Zhang, Yimeng, et al.
Pubblicazione: (2024)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
Laminator: Verifiable ML Property Cards using Hardware-assisted Attestations
di: Duddu, Vasisht, et al.
Pubblicazione: (2024)
di: Duddu, Vasisht, et al.
Pubblicazione: (2024)
FedSECA: Sign Election and Coordinate-wise Aggregation of Gradients for Byzantine Tolerant Federated Learning
di: Benjamin, Joseph Geo, et al.
Pubblicazione: (2024)
di: Benjamin, Joseph Geo, et al.
Pubblicazione: (2024)
Sparse Autoencoder as a Zero-Shot Classifier for Concept Erasing in Text-to-Image Diffusion Models
di: Tian, Zhihua, et al.
Pubblicazione: (2025)
di: Tian, Zhihua, et al.
Pubblicazione: (2025)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
di: Li, Xinfeng, et al.
Pubblicazione: (2025)
di: Li, Xinfeng, et al.
Pubblicazione: (2025)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
di: Lai, Songning, et al.
Pubblicazione: (2024)
di: Lai, Songning, et al.
Pubblicazione: (2024)
CAT: Concept-level backdoor ATtacks for Concept Bottleneck Models
di: Lai, Songning, et al.
Pubblicazione: (2024)
di: Lai, Songning, et al.
Pubblicazione: (2024)
Detecting Malicious Concepts without Image Generation in AI-Generated Content (AIGC)
di: Xu, Kun, et al.
Pubblicazione: (2025)
di: Xu, Kun, et al.
Pubblicazione: (2025)
VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024)
di: Gao, Sensen, et al.
Pubblicazione: (2024)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
di: Zhai, Shengfang, et al.
Pubblicazione: (2024)
di: Zhai, Shengfang, et al.
Pubblicazione: (2024)
REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models
di: Guo, Chongye, et al.
Pubblicazione: (2025)
di: Guo, Chongye, et al.
Pubblicazione: (2025)
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
Intriguing Properties of Diffusion Models: An Empirical Study of the Natural Attack Capability in Text-to-Image Generative Models
di: Sato, Takami, et al.
Pubblicazione: (2023)
di: Sato, Takami, et al.
Pubblicazione: (2023)
FT-Shield: A Watermark Against Unauthorized Fine-tuning in Text-to-Image Diffusion Models
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
BadBlocks: Low-Cost and Stealthy Backdoor Attacks Tailored for Text-to-Image Diffusion Models
di: Wu, Jia, et al.
Pubblicazione: (2025)
di: Wu, Jia, et al.
Pubblicazione: (2025)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
di: Hu, Yuepeng, et al.
Pubblicazione: (2025)
PAL*M: Property Attestation for Large Generative Models
di: Chantasantitam, Prach, et al.
Pubblicazione: (2026)
di: Chantasantitam, Prach, et al.
Pubblicazione: (2026)
Secure and Robust Watermarking for AI-generated Images: A Comprehensive Survey
di: Cao, Jie, et al.
Pubblicazione: (2025)
di: Cao, Jie, et al.
Pubblicazione: (2025)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
CoreMark: Toward Robust and Universal Text Watermarking Technique
di: Meng, Jiale, et al.
Pubblicazione: (2025)
di: Meng, Jiale, et al.
Pubblicazione: (2025)
Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models
di: Chen, Hao, et al.
Pubblicazione: (2025)
di: Chen, Hao, et al.
Pubblicazione: (2025)
What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers
di: Zhang, Chenyu
Pubblicazione: (2026)
di: Zhang, Chenyu
Pubblicazione: (2026)
Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
di: Li, Zida, et al.
Pubblicazione: (2026)
di: Li, Zida, et al.
Pubblicazione: (2026)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
di: Chen, Moyang, et al.
Pubblicazione: (2026)
di: Chen, Moyang, et al.
Pubblicazione: (2026)
When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Do Concept Replacement Techniques Really Erase Unacceptable Concepts?
di: Das, Anudeep, et al.
Pubblicazione: (2025) -
Locket: Robust Feature-Locking Technique for Language Models
di: He, Lipeng, et al.
Pubblicazione: (2025) -
Combining Machine Learning Defenses without Conflicts
di: Duddu, Vasisht, et al.
Pubblicazione: (2024) -
Attesting Distributional Properties of Training Data for Machine Learning
di: Duddu, Vasisht, et al.
Pubblicazione: (2023) -
TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
di: Zhang, Chaoshuo, et al.
Pubblicazione: (2026)