SafeText: Safe Text-to-image Models via Aligning the Text Encoder
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Yuepeng, Jiang, Zhengyuan, Gong, Neil Zhenqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
Refusing Safe Prompts for Multi-modal Large Language Models
por: Shao, Zedian, et al.
Publicado: (2024)
por: Shao, Zedian, et al.
Publicado: (2024)
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
por: Hu, Yuepeng, et al.
Publicado: (2024)
por: Hu, Yuepeng, et al.
Publicado: (2024)
Certifiably Robust Image Watermark
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
Robustness of Vision Foundation Models to Common Perturbations
por: Liu, Hongbin, et al.
Publicado: (2026)
por: Liu, Hongbin, et al.
Publicado: (2026)
Watermark-based Attribution of AI-Generated Content
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
por: Jiang, Zhengyuan, et al.
Publicado: (2024)
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
por: Shao, Zedian, et al.
Publicado: (2026)
por: Shao, Zedian, et al.
Publicado: (2026)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
por: Zhang, Hongxiang, et al.
Publicado: (2024)
por: Zhang, Hongxiang, et al.
Publicado: (2024)
Wukong Framework for Not Safe For Work Detection in Text-to-Image systems
por: Liu, Mingrui, et al.
Publicado: (2025)
por: Liu, Mingrui, et al.
Publicado: (2025)
VideoMarkBench: Benchmarking Robustness of Video Watermarking
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning
por: Zhang, Jinghuai, et al.
Publicado: (2022)
por: Zhang, Jinghuai, et al.
Publicado: (2022)
EditTrack: Detecting and Attributing AI-assisted Image Editing
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
AI-generated Image Detection: Passive or Watermark?
por: Guo, Moyang, et al.
Publicado: (2024)
por: Guo, Moyang, et al.
Publicado: (2024)
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
por: Li, Xinfeng, et al.
Publicado: (2024)
por: Li, Xinfeng, et al.
Publicado: (2024)
Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration
por: Li, Jun, et al.
Publicado: (2026)
por: Li, Jun, et al.
Publicado: (2026)
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
por: Qi, Peigui, et al.
Publicado: (2025)
por: Qi, Peigui, et al.
Publicado: (2025)
Unveiling and Mitigating Memorization in Text-to-image Diffusion Models through Cross Attention
por: Ren, Jie, et al.
Publicado: (2024)
por: Ren, Jie, et al.
Publicado: (2024)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
por: Ren, Jie, et al.
Publicado: (2024)
por: Ren, Jie, et al.
Publicado: (2024)
Your Text Encoder Can Be An Object-Level Watermarking Controller
por: Devulapally, Naresh Kumar, et al.
Publicado: (2025)
por: Devulapally, Naresh Kumar, et al.
Publicado: (2025)
Mudjacking: Patching Backdoor Vulnerabilities in Foundation Models
por: Liu, Hongbin, et al.
Publicado: (2024)
por: Liu, Hongbin, et al.
Publicado: (2024)
Tracing Back the Malicious Clients in Poisoning Attacks to Federated Learning
por: Jia, Yuqi, et al.
Publicado: (2024)
por: Jia, Yuqi, et al.
Publicado: (2024)
Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
por: Zhai, Shengfang, et al.
Publicado: (2024)
por: Zhai, Shengfang, et al.
Publicado: (2024)
SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution
por: Ba, Zhongjie, et al.
Publicado: (2023)
por: Ba, Zhongjie, et al.
Publicado: (2023)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
por: Guo, Ji, et al.
Publicado: (2024)
por: Guo, Ji, et al.
Publicado: (2024)
Espresso: Robust Concept Filtering in Text-to-Image Models
por: Das, Anudeep, et al.
Publicado: (2024)
por: Das, Anudeep, et al.
Publicado: (2024)
Is Diffusion Model Safe? Severe Data Leakage via Gradient-Guided Diffusion Model
por: Meng, Jiayang, et al.
Publicado: (2024)
por: Meng, Jiayang, et al.
Publicado: (2024)
Controllable Adversarial Makeup for Privacy via Text-Guided Diffusion
por: Kwon, Youngjin, et al.
Publicado: (2025)
por: Kwon, Youngjin, et al.
Publicado: (2025)
CopyrightMeter: Revisiting Copyright Protection in Text-to-image Models
por: Xu, Naen, et al.
Publicado: (2024)
por: Xu, Naen, et al.
Publicado: (2024)
A Transfer Attack to Image Watermarks
por: Hu, Yuepeng, et al.
Publicado: (2024)
por: Hu, Yuepeng, et al.
Publicado: (2024)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
por: Liu, Jiangtao, et al.
Publicado: (2025)
por: Liu, Jiangtao, et al.
Publicado: (2025)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
por: Li, Xinfeng, et al.
Publicado: (2025)
por: Li, Xinfeng, et al.
Publicado: (2025)
Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models
por: Shi, Zhuan, et al.
Publicado: (2026)
por: Shi, Zhuan, et al.
Publicado: (2026)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
por: Gao, Sensen, et al.
Publicado: (2024)
por: Gao, Sensen, et al.
Publicado: (2024)
VidLeaks: Membership Inference Attacks Against Text-to-Video Models
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
DIAGNOSIS: Detecting Unauthorized Data Usages in Text-to-image Diffusion Models
por: Wang, Zhenting, et al.
Publicado: (2023)
por: Wang, Zhenting, et al.
Publicado: (2023)
REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models
por: Guo, Chongye, et al.
Publicado: (2025)
por: Guo, Chongye, et al.
Publicado: (2025)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
por: Chen, Moyang, et al.
Publicado: (2026)
por: Chen, Moyang, et al.
Publicado: (2026)
TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
por: Zhang, Chaoshuo, et al.
Publicado: (2026)
por: Zhang, Chaoshuo, et al.
Publicado: (2026)
Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
por: Li, Zida, et al.
Publicado: (2026)
por: Li, Zida, et al.
Publicado: (2026)
Multimodal Pragmatic Jailbreak on Text-to-image Models
por: Liu, Tong, et al.
Publicado: (2024)
por: Liu, Tong, et al.
Publicado: (2024)
Ejemplares similares
-
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025) -
Refusing Safe Prompts for Multi-modal Large Language Models
por: Shao, Zedian, et al.
Publicado: (2024) -
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
por: Hu, Yuepeng, et al.
Publicado: (2024) -
Certifiably Robust Image Watermark
por: Jiang, Zhengyuan, et al.
Publicado: (2024) -
Robustness of Vision Foundation Models to Common Perturbations
por: Liu, Hongbin, et al.
Publicado: (2026)