Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Huming, Chen, Guanxu, Zhang, Mi, Zhang, Xiaohan, You, Xiaoyu, Yang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BELT: Old-School Backdoor Attacks can Evade the State-of-the-Art Defense with Backdoor Exclusivity Lifting
par: Qiu, Huming, et autres
Publié: (2023)
par: Qiu, Huming, et autres
Publié: (2023)
PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization
par: Liu, Mingshuo, et autres
Publié: (2026)
par: Liu, Mingshuo, et autres
Publié: (2026)
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
par: Li, Xinfeng, et autres
Publié: (2024)
par: Li, Xinfeng, et autres
Publié: (2024)
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
par: Geng, Runpeng, et autres
Publié: (2025)
par: Geng, Runpeng, et autres
Publié: (2025)
Finding a Wolf in Sheep's Clothing: Combating Adversarial Text-To-Image Prompts with Text Summarization
par: Cooper, Portia, et autres
Publié: (2024)
par: Cooper, Portia, et autres
Publié: (2024)
Text Embedding Inversion Security for Multilingual Language Models
par: Chen, Yiyi, et autres
Publié: (2024)
par: Chen, Yiyi, et autres
Publié: (2024)
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2026)
par: Liu, Renyang, et autres
Publié: (2026)
SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
par: Dong, Jianshuo, et autres
Publié: (2025)
par: Dong, Jianshuo, et autres
Publié: (2025)
SEW: Strengthening Robustness of Black-box DNN Watermarking via Specificity Enhancement
par: Qiu, Huming, et autres
Publié: (2026)
par: Qiu, Huming, et autres
Publié: (2026)
Groot: Adversarial Testing for Generative Text-to-Image Models with Tree-based Semantic Transformation
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Goal-guided Generative Prompt Injection Attack on Large Language Models
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
par: Xu, Jiahao, et autres
Publié: (2026)
par: Xu, Jiahao, et autres
Publié: (2026)
MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content
par: Guo, Ruoqi, et autres
Publié: (2026)
par: Guo, Ruoqi, et autres
Publié: (2026)
Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation
par: Chen, Sixu, et autres
Publié: (2026)
par: Chen, Sixu, et autres
Publié: (2026)
Token-level Data Selection for Safe LLM Fine-tuning
par: Li, Yanping, et autres
Publié: (2026)
par: Li, Yanping, et autres
Publié: (2026)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
Imitate Before Detect: Aligning Machine Stylistic Preference for Machine-Revised Text Detection
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
par: Liu, Junhao, et autres
Publié: (2025)
par: Liu, Junhao, et autres
Publié: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
par: Li, Tianhao, et autres
Publié: (2024)
par: Li, Tianhao, et autres
Publié: (2024)
Adversarial Attacks on Parts of Speech: An Empirical Study in Text-to-Image Generation
par: Shahariar, G M, et autres
Publié: (2024)
par: Shahariar, G M, et autres
Publié: (2024)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
par: Wang, Kun, et autres
Publié: (2026)
par: Wang, Kun, et autres
Publié: (2026)
Modeling the Attack: Detecting AI-Generated Text by Quantifying Adversarial Perturbations
par: Teja, Lekkala Sai, et autres
Publié: (2025)
par: Teja, Lekkala Sai, et autres
Publié: (2025)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
par: Piet, Julien, et autres
Publié: (2023)
par: Piet, Julien, et autres
Publié: (2023)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
par: Zhou, Kaiwen, et autres
Publié: (2025)
par: Zhou, Kaiwen, et autres
Publié: (2025)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
LeakDojo: Decoding the Leakage Threats of RAG Systems
par: Zhang, Maosen, et autres
Publié: (2026)
par: Zhang, Maosen, et autres
Publié: (2026)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
par: Su, Yanghao, et autres
Publié: (2026)
par: Su, Yanghao, et autres
Publié: (2026)
Prompt Injection as Role Confusion
par: Ye, Charles, et autres
Publié: (2026)
par: Ye, Charles, et autres
Publié: (2026)
IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents
par: An, Hengyu, et autres
Publié: (2025)
par: An, Hengyu, et autres
Publié: (2025)
Soft Begging: Modular and Efficient Shielding of LLMs against Prompt Injection and Jailbreaking based on Prompt Tuning
par: Ostermann, Simon, et autres
Publié: (2024)
par: Ostermann, Simon, et autres
Publié: (2024)
Are All Prompt Components Value-Neutral? Understanding the Heterogeneous Adversarial Robustness of Dissected Prompt in Large Language Models
par: Zheng, Yujia, et autres
Publié: (2025)
par: Zheng, Yujia, et autres
Publié: (2025)
Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
par: Kim, Jinhwa, et autres
Publié: (2025)
par: Kim, Jinhwa, et autres
Publié: (2025)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
par: Huo, Jiahao, et autres
Publié: (2026)
par: Huo, Jiahao, et autres
Publié: (2026)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
par: Cao, Bochuan, et autres
Publié: (2025)
par: Cao, Bochuan, et autres
Publié: (2025)
Documents similaires
-
BELT: Old-School Backdoor Attacks can Evade the State-of-the-Art Defense with Backdoor Exclusivity Lifting
par: Qiu, Huming, et autres
Publié: (2023) -
PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization
par: Liu, Mingshuo, et autres
Publié: (2026) -
SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models
par: Li, Xinfeng, et autres
Publié: (2024) -
PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
par: Geng, Runpeng, et autres
Publié: (2025) -
Finding a Wolf in Sheep's Clothing: Combating Adversarial Text-To-Image Prompts with Text Summarization
par: Cooper, Portia, et autres
Publié: (2024)