Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Zhengyuan, Hu, Yuepeng, Yang, Yuchen, Cao, Yinzhi, Gong, Neil Zhenqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
par: Hu, Yuepeng, et autres
Publié: (2025)
par: Hu, Yuepeng, et autres
Publié: (2025)
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
par: Hu, Yuepeng, et autres
Publié: (2024)
par: Hu, Yuepeng, et autres
Publié: (2024)
Watermark-based Attribution of AI-Generated Content
par: Jiang, Zhengyuan, et autres
Publié: (2024)
par: Jiang, Zhengyuan, et autres
Publié: (2024)
Certifiably Robust Image Watermark
par: Jiang, Zhengyuan, et autres
Publié: (2024)
par: Jiang, Zhengyuan, et autres
Publié: (2024)
A Transfer Attack to Image Watermarks
par: Hu, Yuepeng, et autres
Publié: (2024)
par: Hu, Yuepeng, et autres
Publié: (2024)
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
par: Shao, Zedian, et autres
Publié: (2026)
par: Shao, Zedian, et autres
Publié: (2026)
Robustness of Vision Foundation Models to Common Perturbations
par: Liu, Hongbin, et autres
Publié: (2026)
par: Liu, Hongbin, et autres
Publié: (2026)
Refusing Safe Prompts for Multi-modal Large Language Models
par: Shao, Zedian, et autres
Publié: (2024)
par: Shao, Zedian, et autres
Publié: (2024)
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
par: Tian, Yuan, et autres
Publié: (2026)
par: Tian, Yuan, et autres
Publié: (2026)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
par: Yan, Song, et autres
Publié: (2025)
par: Yan, Song, et autres
Publié: (2025)
EditTrack: Detecting and Attributing AI-assisted Image Editing
par: Jiang, Zhengyuan, et autres
Publié: (2025)
par: Jiang, Zhengyuan, et autres
Publié: (2025)
AI-generated Image Detection: Passive or Watermark?
par: Guo, Moyang, et autres
Publié: (2024)
par: Guo, Moyang, et autres
Publié: (2024)
Fingerprinting LLMs via Prompt Injection
par: Hu, Yuepeng, et autres
Publié: (2025)
par: Hu, Yuepeng, et autres
Publié: (2025)
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Jailbreaking Attack against Multimodal Large Language Model
par: Niu, Zhenxing, et autres
Publié: (2024)
par: Niu, Zhenxing, et autres
Publié: (2024)
VideoMarkBench: Benchmarking Robustness of Video Watermarking
par: Jiang, Zhengyuan, et autres
Publié: (2025)
par: Jiang, Zhengyuan, et autres
Publié: (2025)
Image-Based Geolocation Using Large Vision-Language Models
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
par: Gao, Sensen, et autres
Publié: (2024)
par: Gao, Sensen, et autres
Publié: (2024)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
par: Li, Xinfeng, et autres
Publié: (2025)
par: Li, Xinfeng, et autres
Publié: (2025)
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
par: Li, Xinfeng, et autres
Publié: (2024)
par: Li, Xinfeng, et autres
Publié: (2024)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
par: Jiang, Yifan, et autres
Publié: (2024)
par: Jiang, Yifan, et autres
Publié: (2024)
Mudjacking: Patching Backdoor Vulnerabilities in Foundation Models
par: Liu, Hongbin, et autres
Publié: (2024)
par: Liu, Hongbin, et autres
Publié: (2024)
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
par: Miao, Ziqi, et autres
Publié: (2025)
par: Miao, Ziqi, et autres
Publié: (2025)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
par: Liu, Jiangtao, et autres
Publié: (2025)
par: Liu, Jiangtao, et autres
Publié: (2025)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Doubly-Universal Adversarial Perturbations: Deceiving Vision-Language Models Across Both Images and Text with a Single Perturbation
par: Kim, Hee-Seon, et autres
Publié: (2024)
par: Kim, Hee-Seon, et autres
Publié: (2024)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
par: Liao, Qilin, et autres
Publié: (2025)
par: Liao, Qilin, et autres
Publié: (2025)
Failures to Find Transferable Image Jailbreaks Between Vision-Language Models
par: Schaeffer, Rylan, et autres
Publié: (2024)
par: Schaeffer, Rylan, et autres
Publié: (2024)
Text is All You Need for Vision-Language Model Jailbreaking
par: Chen, Yihang, et autres
Publié: (2026)
par: Chen, Yihang, et autres
Publié: (2026)
Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
par: Ding, Yi, et autres
Publié: (2025)
par: Ding, Yi, et autres
Publié: (2025)
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
par: Zhang, Ce, et autres
Publié: (2026)
par: Zhang, Ce, et autres
Publié: (2026)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
par: Chen, Moyang, et autres
Publié: (2026)
par: Chen, Moyang, et autres
Publié: (2026)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Tracing Back the Malicious Clients in Poisoning Attacks to Federated Learning
par: Jia, Yuqi, et autres
Publié: (2024)
par: Jia, Yuqi, et autres
Publié: (2024)
Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector
par: Huang, Youcheng, et autres
Publié: (2024)
par: Huang, Youcheng, et autres
Publié: (2024)
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
par: Chin, Zhi-Yi, et autres
Publié: (2024)
par: Chin, Zhi-Yi, et autres
Publié: (2024)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
par: Hao, Shuyang, et autres
Publié: (2025)
par: Hao, Shuyang, et autres
Publié: (2025)
Documents similaires
-
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
par: Hu, Yuepeng, et autres
Publié: (2025) -
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
par: Hu, Yuepeng, et autres
Publié: (2024) -
Watermark-based Attribution of AI-Generated Content
par: Jiang, Zhengyuan, et autres
Publié: (2024) -
Certifiably Robust Image Watermark
par: Jiang, Zhengyuan, et autres
Publié: (2024) -
A Transfer Attack to Image Watermarks
par: Hu, Yuepeng, et autres
Publié: (2024)