MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Xi, Liu, Yiwen, Wang, Lina, Wang, Run, Yang, Geying, Hou, Yufei, Yu, Jiayi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Metaphor-based Jailbreak Attacks on Text-to-Image Models
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
di: Li, Linbao, et al.
Pubblicazione: (2025)
di: Li, Linbao, et al.
Pubblicazione: (2025)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
di: Wang, Yiming, et al.
Pubblicazione: (2024)
di: Wang, Yiming, et al.
Pubblicazione: (2024)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
di: Yan, Song, et al.
Pubblicazione: (2025)
di: Yan, Song, et al.
Pubblicazione: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
di: Wu, Yixin, et al.
Pubblicazione: (2023)
di: Wu, Yixin, et al.
Pubblicazione: (2023)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
di: Li, Qizhang, et al.
Pubblicazione: (2024)
di: Li, Qizhang, et al.
Pubblicazione: (2024)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
EVA: Editing for Versatile Alignment against Jailbreaks
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Defending Jailbreak Prompts via In-Context Adversarial Game
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
Combinational Backdoor Attack against Customized Text-to-Image Models
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
di: Wang, Yanyun, et al.
Pubblicazione: (2026)
di: Wang, Yanyun, et al.
Pubblicazione: (2026)
GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance
di: Zhang, Zaixi, et al.
Pubblicazione: (2025)
di: Zhang, Zaixi, et al.
Pubblicazione: (2025)
ShallowJail: Steering Jailbreaks against Large Language Models
di: Liu, Shang, et al.
Pubblicazione: (2026)
di: Liu, Shang, et al.
Pubblicazione: (2026)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024)
di: Gao, Sensen, et al.
Pubblicazione: (2024)
ProxyPrompt: Securing System Prompts against Prompt Extraction Attacks
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models
di: Choi, Wonwoo, et al.
Pubblicazione: (2026)
di: Choi, Wonwoo, et al.
Pubblicazione: (2026)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs
di: Liu, Yize, et al.
Pubblicazione: (2025)
di: Liu, Yize, et al.
Pubblicazione: (2025)
Automatic Jailbreaking of the Text-to-Image Generative AI Systems
di: Kim, Minseon, et al.
Pubblicazione: (2024)
di: Kim, Minseon, et al.
Pubblicazione: (2024)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
di: Chen, Jianming, et al.
Pubblicazione: (2026)
di: Chen, Jianming, et al.
Pubblicazione: (2026)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
di: Deng, Gelei, et al.
Pubblicazione: (2024)
di: Deng, Gelei, et al.
Pubblicazione: (2024)
Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
di: Chen, Yulin, et al.
Pubblicazione: (2025)
di: Chen, Yulin, et al.
Pubblicazione: (2025)
Towards Action Hijacking of Large Language Model-based Agent
di: Zhang, Yuyang, et al.
Pubblicazione: (2024)
di: Zhang, Yuyang, et al.
Pubblicazione: (2024)
PLA: Prompt Learning Attack against Text-to-Image Generative Models
di: Lyu, Xinqi, et al.
Pubblicazione: (2025)
di: Lyu, Xinqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Metaphor-based Jailbreak Attacks on Text-to-Image Models
di: Zhang, Chenyu, et al.
Pubblicazione: (2025) -
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
di: Li, Linbao, et al.
Pubblicazione: (2025) -
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
di: Zhao, Shiqian, et al.
Pubblicazione: (2025) -
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
di: Zhang, Chenyu, et al.
Pubblicazione: (2025) -
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)