TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chaoshuo, Liang, Yibo, Tian, Mengke, Lin, Chenhao, Zhao, Zhengyu, Yang, Le, Zhang, Chong, Zhang, Yang, Shen, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Privacy on the Fly: A Predictive Adversarial Transformation Network for Mobile Sensor Data
par: Song, Tianle, et autres
Publié: (2025)
par: Song, Tianle, et autres
Publié: (2025)
Systematic Categorization, Construction and Evaluation of New Attacks against Multi-modal Mobile GUI Agents
par: Yang, Yulong, et autres
Publié: (2024)
par: Yang, Yulong, et autres
Publié: (2024)
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
par: Liu, Mingrui, et autres
Publié: (2025)
par: Liu, Mingrui, et autres
Publié: (2025)
A Survey on Adversarial Machine Learning for Code Data: Realistic Threats, Countermeasures, and Interpretations
par: Yang, Yulong, et autres
Publié: (2024)
par: Yang, Yulong, et autres
Publié: (2024)
LESSON: Multi-Label Adversarial False Data Injection Attack for Deep Learning Locational Detection
par: Tian, Jiwei, et autres
Publié: (2024)
par: Tian, Jiwei, et autres
Publié: (2024)
A Comparative Study of Fuzzers and Static Analysis Tools for Finding Memory Unsafety in C and C++
par: Hassler, Keno, et autres
Publié: (2025)
par: Hassler, Keno, et autres
Publié: (2025)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
par: Wu, Yixin, et autres
Publié: (2023)
par: Wu, Yixin, et autres
Publié: (2023)
Quantization Aware Attack: Enhancing Transferable Adversarial Attacks by Model Quantization
par: Yang, Yulong, et autres
Publié: (2023)
par: Yang, Yulong, et autres
Publié: (2023)
MGTBench: Benchmarking Machine-Generated Text Detection
par: He, Xinlei, et autres
Publié: (2023)
par: He, Xinlei, et autres
Publié: (2023)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models
par: Wang, Kai, et autres
Publié: (2026)
par: Wang, Kai, et autres
Publié: (2026)
Revisiting Training-Inference Trigger Intensity in Backdoor Attacks
par: Lin, Chenhao, et autres
Publié: (2025)
par: Lin, Chenhao, et autres
Publié: (2025)
Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution
par: Wu, Yixin, et autres
Publié: (2024)
par: Wu, Yixin, et autres
Publié: (2024)
Typographic Attacks in a Multi-Image Setting
par: Wang, Xiaomeng, et autres
Publié: (2025)
par: Wang, Xiaomeng, et autres
Publié: (2025)
Prompt Stealing Attacks Against Text-to-Image Generation Models
par: Shen, Xinyue, et autres
Publié: (2023)
par: Shen, Xinyue, et autres
Publié: (2023)
Revisiting Adversarial Patch Defenses on Object Detectors: Unified Evaluation, Large-Scale Dataset, and New Insights
par: Zheng, Junhao, et autres
Publié: (2025)
par: Zheng, Junhao, et autres
Publié: (2025)
Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models
par: Liu, Yugeng, et autres
Publié: (2023)
par: Liu, Yugeng, et autres
Publié: (2023)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
par: Zhu, Zhenhao, et autres
Publié: (2026)
par: Zhu, Zhenhao, et autres
Publié: (2026)
Traceable AI-driven Avatars Using Multi-factors of Physical World and Metaverse
par: Yang, Kedi, et autres
Publié: (2024)
par: Yang, Kedi, et autres
Publié: (2024)
Prediction Inconsistency Helps Achieve Generalizable Detection of Adversarial Examples
par: Han, Sicong, et autres
Publié: (2025)
par: Han, Sicong, et autres
Publié: (2025)
Improving Adversarial Transferability on Vision Transformers via Forward Propagation Refinement
par: Ren, Yuchen, et autres
Publié: (2025)
par: Ren, Yuchen, et autres
Publié: (2025)
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
par: Xu, Wenzhuo, et autres
Publié: (2026)
par: Xu, Wenzhuo, et autres
Publié: (2026)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
par: Zhao, Shiqian, et autres
Publié: (2025)
par: Zhao, Shiqian, et autres
Publié: (2025)
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
par: Chu, Junjie, et autres
Publié: (2025)
par: Chu, Junjie, et autres
Publié: (2025)
Generalizable Targeted Data Poisoning against Varying Physical Objects
par: Chen, Zhizhen, et autres
Publié: (2024)
par: Chen, Zhizhen, et autres
Publié: (2024)
Physical 3D Adversarial Attacks against Monocular Depth Estimation in Autonomous Driving
par: Zheng, Junhao, et autres
Publié: (2024)
par: Zheng, Junhao, et autres
Publié: (2024)
Espresso: Robust Concept Filtering in Text-to-Image Models
par: Das, Anudeep, et autres
Publié: (2024)
par: Das, Anudeep, et autres
Publié: (2024)
GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation
par: Zhai, Shengfang, et autres
Publié: (2025)
par: Zhai, Shengfang, et autres
Publié: (2025)
CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models
par: Zhao, Mengnan, et autres
Publié: (2026)
par: Zhao, Mengnan, et autres
Publié: (2026)
Don't Trust Your Upstream: Exploiting LLM Multi-Agent System via Topology-Guided Adversarial Propagation
par: Liang, Ruichao, et autres
Publié: (2025)
par: Liang, Ruichao, et autres
Publié: (2025)
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
Improving Integrated Gradient-based Transferable Adversarial Examples by Refining the Integration Path
par: Ren, Yuchen, et autres
Publié: (2024)
par: Ren, Yuchen, et autres
Publié: (2024)
Provably Robust Multi-bit Watermarking for AI-generated Text
par: Qu, Wenjie, et autres
Publié: (2024)
par: Qu, Wenjie, et autres
Publié: (2024)
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm
par: Leng, Ye, et autres
Publié: (2026)
par: Leng, Ye, et autres
Publié: (2026)
Two-layer consensus based on master-slave consortium chain data sharing for Internet of Vehicles
par: Zhao, Feng, et autres
Publié: (2024)
par: Zhao, Feng, et autres
Publié: (2024)
Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace
par: Yang, Jinluan, et autres
Publié: (2024)
par: Yang, Jinluan, et autres
Publié: (2024)
Concept Unlearning by Modeling Key Steps of Diffusion Process
par: Zhang, Chaoshuo, et autres
Publié: (2025)
par: Zhang, Chaoshuo, et autres
Publié: (2025)
Toward Web 4.0: Bidirectional Trust between AI Agents and Blockchain
par: Xia, Yunfeng, et autres
Publié: (2026)
par: Xia, Yunfeng, et autres
Publié: (2026)
Evaluating Concept Filtering Defenses against Child Sexual Abuse Material Generation by Text-to-Image Models
par: Cretu, Ana-Maria, et autres
Publié: (2025)
par: Cretu, Ana-Maria, et autres
Publié: (2025)
Documents similaires
-
Privacy on the Fly: A Predictive Adversarial Transformation Network for Mobile Sensor Data
par: Song, Tianle, et autres
Publié: (2025) -
Systematic Categorization, Construction and Evaluation of New Attacks against Multi-modal Mobile GUI Agents
par: Yang, Yulong, et autres
Publié: (2024) -
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
par: Liu, Mingrui, et autres
Publié: (2025) -
A Survey on Adversarial Machine Learning for Code Data: Realistic Threats, Countermeasures, and Interpretations
par: Yang, Yulong, et autres
Publié: (2024) -
LESSON: Multi-Label Adversarial False Data Injection Attack for Deep Learning Locational Detection
par: Tian, Jiwei, et autres
Publié: (2024)