$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choi, Wonwoo, Seo, Minjae, Song, Minkyoo, Heo, Hwanjo, Shin, Seungwon, You, Myoungsung |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoPatch: Multi-Agent Framework for Patching Real-World CVE Vulnerabilities
par: Seo, Minjae, et autres
Publié: (2025)
par: Seo, Minjae, et autres
Publié: (2025)
EO-VLM: VLM-Guided Energy Overload Attacks on Vision Models
par: Seo, Minjae, et autres
Publié: (2025)
par: Seo, Minjae, et autres
Publié: (2025)
MUFFLER: Secure Tor Traffic Obfuscation with Dynamic Connection Shuffling and Splitting
par: Seo, Minjae, et autres
Publié: (2025)
par: Seo, Minjae, et autres
Publié: (2025)
PassREfinder-FL: Privacy-Preserving Credential Stuffing Risk Prediction via Graph-Based Federated Learning for Representing Password Reuse between Websites
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
SecTracer: A Framework for Uncovering the Root Causes of Network Intrusions via Security Provenance
par: Lee, Seunghyeon, et autres
Publié: (2025)
par: Lee, Seunghyeon, et autres
Publié: (2025)
Subgraph Reconstruction Attacks on Graph RAG Deployments with Practical Defenses
par: Song, Minkyoo, et autres
Publié: (2026)
par: Song, Minkyoo, et autres
Publié: (2026)
Heimdallr: Fingerprinting SD-WAN Control-Plane Architecture via Encrypted Control Traffic
par: Seo, Minjae, et autres
Publié: (2025)
par: Seo, Minjae, et autres
Publié: (2025)
BEACON: Automatic Container Policy Generation using Environment-aware Dynamic Analysis
par: Kang, Haney, et autres
Publié: (2025)
par: Kang, Haney, et autres
Publié: (2025)
Illusion Worlds: Deceptive UI Attacks in Social VR
par: Lee, Junhee, et autres
Publié: (2025)
par: Lee, Junhee, et autres
Publié: (2025)
Claim-Guided Textual Backdoor Attack for Practical Applications
par: Song, Minkyoo, et autres
Publié: (2024)
par: Song, Minkyoo, et autres
Publié: (2024)
Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
When LLMs Go Online: The Emerging Threat of Web-Enabled LLMs
par: Kim, Hanna, et autres
Publié: (2024)
par: Kim, Hanna, et autres
Publié: (2024)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
par: Kim, Jaehan, et autres
Publié: (2024)
par: Kim, Jaehan, et autres
Publié: (2024)
Ambusher: Exploring the Security of Distributed SDN Controllers Through Protocol State Fuzzing
par: Kim, Jinwoo, et autres
Publié: (2025)
par: Kim, Jinwoo, et autres
Publié: (2025)
Voice Jailbreak Attacks Against GPT-4o
par: Shen, Xinyue, et autres
Publié: (2024)
par: Shen, Xinyue, et autres
Publié: (2024)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
par: Zhang, Chenyu, et autres
Publié: (2025)
par: Zhang, Chenyu, et autres
Publié: (2025)
Automatic Jailbreaking of the Text-to-Image Generative AI Systems
par: Kim, Minseon, et autres
Publié: (2024)
par: Kim, Minseon, et autres
Publié: (2024)
Jailbreaking Generative AI: Empowering Novices to Conduct Phishing Attacks
par: Mishra, Rina, et autres
Publié: (2025)
par: Mishra, Rina, et autres
Publié: (2025)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
par: Piet, Julien, et autres
Publié: (2025)
par: Piet, Julien, et autres
Publié: (2025)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
par: Gao, Sensen, et autres
Publié: (2024)
par: Gao, Sensen, et autres
Publié: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
par: Ye, Xi, et autres
Publié: (2026)
par: Ye, Xi, et autres
Publié: (2026)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
par: Cui, Tiehan, et autres
Publié: (2025)
par: Cui, Tiehan, et autres
Publié: (2025)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
par: Mao, Yanxu, et autres
Publié: (2025)
par: Mao, Yanxu, et autres
Publié: (2025)
Untargeted Jailbreak Attack
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
par: Zhong, Xingwei, et autres
Publié: (2025)
par: Zhong, Xingwei, et autres
Publié: (2025)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
par: Zhou, Yuqi, et autres
Publié: (2024)
par: Zhou, Yuqi, et autres
Publié: (2024)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
par: Zhang, Junke, et autres
Publié: (2026)
par: Zhang, Junke, et autres
Publié: (2026)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
par: Wu, Yuanwei, et autres
Publié: (2023)
par: Wu, Yuanwei, et autres
Publié: (2023)
When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems
par: Zhao, Shiqian, et autres
Publié: (2025)
par: Zhao, Shiqian, et autres
Publié: (2025)
Attacks on Approximate Caches in Text-to-Image Diffusion Models
par: Sun, Desen, et autres
Publié: (2025)
par: Sun, Desen, et autres
Publié: (2025)
Attack as Defense: Run-time Backdoor Implantation for Image Content Protection
par: Zhang, Haichuan, et autres
Publié: (2024)
par: Zhang, Haichuan, et autres
Publié: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Asymmetric Bias in Text-to-Image Generation with Adversarial Attacks
par: Shahgir, Haz Sameen, et autres
Publié: (2023)
par: Shahgir, Haz Sameen, et autres
Publié: (2023)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
par: Yin, Ziyi, et autres
Publié: (2025)
par: Yin, Ziyi, et autres
Publié: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
par: Guo, Yangyang, et autres
Publié: (2025)
par: Guo, Yangyang, et autres
Publié: (2025)
Documents similaires
-
AutoPatch: Multi-Agent Framework for Patching Real-World CVE Vulnerabilities
par: Seo, Minjae, et autres
Publié: (2025) -
EO-VLM: VLM-Guided Energy Overload Attacks on Vision Models
par: Seo, Minjae, et autres
Publié: (2025) -
MUFFLER: Secure Tor Traffic Obfuscation with Dynamic Connection Shuffling and Splitting
par: Seo, Minjae, et autres
Publié: (2025) -
PassREfinder-FL: Privacy-Preserving Credential Stuffing Risk Prediction via Graph-Based Federated Learning for Representing Password Reuse between Websites
par: Kim, Jaehan, et autres
Publié: (2025) -
SecTracer: A Framework for Uncovering the Root Causes of Network Intrusions via Security Provenance
par: Lee, Seunghyeon, et autres
Publié: (2025)