Moderator: Moderating Text-to-Image Diffusion Models through Fine-grained Context-based Policies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Peiran, Li, Qiyu, Yu, Longxuan, Wang, Ziyao, Li, Ang, Jin, Haojian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OAuthHub: Mitigating OAuth Data Overaccess through a Local Data Hub
par: Li, Qiyu, et autres
Publié: (2026)
par: Li, Qiyu, et autres
Publié: (2026)
Towards Building Non-Fine-Tunable Foundation Models
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
Robustness of Watermarking on Text-to-Image Diffusion Models
par: Wu, Xiaodong, et autres
Publié: (2024)
par: Wu, Xiaodong, et autres
Publié: (2024)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models
par: Yuan, Lingzhi, et autres
Publié: (2025)
par: Yuan, Lingzhi, et autres
Publié: (2025)
TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis
par: Wang, Longtian, et autres
Publié: (2025)
par: Wang, Longtian, et autres
Publié: (2025)
LoRA-Key: User-Centric LoRA Watermarking for Text-to-Image Diffusion Models
par: Wang, Yaopeng, et autres
Publié: (2026)
par: Wang, Yaopeng, et autres
Publié: (2026)
Toxic Ink on Immutable Paper: Content Moderation for Ethereum Input Data Messages (IDMs)
par: Xiong, Xihan, et autres
Publié: (2025)
par: Xiong, Xihan, et autres
Publié: (2025)
Reframing LLM Agent Security as an Agent-Human Interaction Problem
par: Wang, Peiran, et autres
Publié: (2026)
par: Wang, Peiran, et autres
Publié: (2026)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
par: Wang, Peiran, et autres
Publié: (2024)
par: Wang, Peiran, et autres
Publié: (2024)
Accelerating Private Large Transformers Inference through Fine-grained Collaborative Computation
par: Chen, Yuntian, et autres
Publié: (2024)
par: Chen, Yuntian, et autres
Publié: (2024)
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
par: Dai, Haoran, et autres
Publié: (2025)
par: Dai, Haoran, et autres
Publié: (2025)
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
par: Li, Ang, et autres
Publié: (2024)
par: Li, Ang, et autres
Publié: (2024)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
par: Zhao, Shiqian, et autres
Publié: (2025)
par: Zhao, Shiqian, et autres
Publié: (2025)
Supply Chain Network Security Investment Strategies Based on Nonlinear Budget Constraints: The Moderating Roles of Market Share and Attack Risk
par: Cheng, Jiajie, et autres
Publié: (2025)
par: Cheng, Jiajie, et autres
Publié: (2025)
PT-Mark: Invisible Watermarking for Text-to-image Diffusion Models via Semantic-aware Pivotal Tuning
par: Wang, Yaopeng, et autres
Publié: (2025)
par: Wang, Yaopeng, et autres
Publié: (2025)
Fine-grained Manipulation Attacks to Local Differential Privacy Protocols for Data Streams
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
Enabling Contextual Soft Moderation on Social Media through Contrastive Textual Deviation
par: Paudel, Pujan, et autres
Publié: (2024)
par: Paudel, Pujan, et autres
Publié: (2024)
SoK: Content Moderation Schemes in End-to-End Encrypted Systems
par: Rahalkar, Chaitanya, et autres
Publié: (2022)
par: Rahalkar, Chaitanya, et autres
Publié: (2022)
Attacks on Approximate Caches in Text-to-Image Diffusion Models
par: Sun, Desen, et autres
Publié: (2025)
par: Sun, Desen, et autres
Publié: (2025)
An Evaluation of Chat Safety Moderations in Roblox
par: Kaushik, Priya, et autres
Publié: (2026)
par: Kaushik, Priya, et autres
Publié: (2026)
Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models
par: Wang, Kai, et autres
Publié: (2026)
par: Wang, Kai, et autres
Publié: (2026)
RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation
par: Tafreshian, Benyamin
Publié: (2025)
par: Tafreshian, Benyamin
Publié: (2025)
DP-SAPF: Saliency-Aware Parameter Fine-tuning of Public Models for Differentially Private Image Synthesis
par: Gong, Chen, et autres
Publié: (2026)
par: Gong, Chen, et autres
Publié: (2026)
MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
par: Ye, Xi, et autres
Publié: (2026)
par: Ye, Xi, et autres
Publié: (2026)
Black-box Membership Inference Attacks against Fine-tuned Diffusion Models
par: Pang, Yan, et autres
Publié: (2023)
par: Pang, Yan, et autres
Publié: (2023)
Shake to Leak: Fine-tuning Diffusion Models Can Amplify the Generative Privacy Risk
par: Li, Zhangheng, et autres
Publié: (2024)
par: Li, Zhangheng, et autres
Publié: (2024)
Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
par: Li, Xiangfang, et autres
Publié: (2025)
par: Li, Xiangfang, et autres
Publié: (2025)
X-Guard: Multilingual Guard Agent for Content Moderation
par: Upadhayay, Bibek, et autres
Publié: (2025)
par: Upadhayay, Bibek, et autres
Publié: (2025)
Securing Operating Systems Through Fine-grained Kernel Access Limitation for IoT Systems
par: Zhan, Dongyang, et autres
Publié: (2025)
par: Zhan, Dongyang, et autres
Publié: (2025)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
par: Huang, Tiansheng, et autres
Publié: (2025)
par: Huang, Tiansheng, et autres
Publié: (2025)
TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
par: Mo, Yichuan, et autres
Publié: (2024)
par: Mo, Yichuan, et autres
Publié: (2024)
Predictive Auditing of Hidden Tokens in LLM APIs via Reasoning Length Estimation
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services
par: Sun, Guoheng, et autres
Publié: (2025)
par: Sun, Guoheng, et autres
Publié: (2025)
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
par: Liu, Songyang, et autres
Publié: (2026)
par: Liu, Songyang, et autres
Publié: (2026)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
par: Wu, Yixin, et autres
Publié: (2023)
par: Wu, Yixin, et autres
Publié: (2023)
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
par: Zhao, Mengnan, et autres
Publié: (2026)
par: Zhao, Mengnan, et autres
Publié: (2026)
Convergent Privacy Framework for Multi-layer GNNs through Contractive Message Passing
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
Documents similaires
-
OAuthHub: Mitigating OAuth Data Overaccess through a Local Data Hub
par: Li, Qiyu, et autres
Publié: (2026) -
Towards Building Non-Fine-Tunable Foundation Models
par: Wang, Ziyao, et autres
Publié: (2026) -
Robustness of Watermarking on Text-to-Image Diffusion Models
par: Wu, Xiaodong, et autres
Publié: (2024) -
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024) -
PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models
par: Yuan, Lingzhi, et autres
Publié: (2025)