JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Haolun, He, Yu, Chen, Tailun, Shao, Shuo, Chu, Zhixuan, Zhou, Hongbin, Tao, Lan, Qin, Zhan, Ren, Kui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
par: Chen, Tailun, et autres
Publié: (2025)
par: Chen, Tailun, et autres
Publié: (2025)
Prompt-Consistency Image Generation (PCIG): A Unified Framework Integrating LLMs, Knowledge Graphs, and Controllable Diffusion Models
par: Sun, Yichen, et autres
Publié: (2024)
par: Sun, Yichen, et autres
Publié: (2024)
MAJIC: Markovian Adaptive Jailbreaking via Iterative Composition of Diverse Innovative Strategies
par: Qi, Weiwei, et autres
Publié: (2025)
par: Qi, Weiwei, et autres
Publié: (2025)
Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets
par: Yang, Yuchen, et autres
Publié: (2026)
par: Yang, Yuchen, et autres
Publié: (2026)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
par: Mou, Zhiyi, et autres
Publié: (2026)
par: Mou, Zhiyi, et autres
Publié: (2026)
Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint
par: Liu, Zhihao, et autres
Publié: (2025)
par: Liu, Zhihao, et autres
Publié: (2025)
DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
par: Shao, Shuo, et autres
Publié: (2024)
par: Shao, Shuo, et autres
Publié: (2024)
A Causal Explainable Guardrails for Large Language Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
Untargeted Jailbreak Attack
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
par: He, Zeqing, et autres
Publié: (2024)
par: He, Zeqing, et autres
Publié: (2024)
TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
par: Zeng, Churui, et autres
Publié: (2026)
par: Zeng, Churui, et autres
Publié: (2026)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
LLM-Guided Multi-View Hypergraph Learning for Human-Centric Explainable Recommendation
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
par: Teng, Ma, et autres
Publié: (2024)
par: Teng, Ma, et autres
Publié: (2024)
REFINE: Inversion-Free Backdoor Defense via Model Reprogramming
par: Chen, Yukun, et autres
Publié: (2025)
par: Chen, Yukun, et autres
Publié: (2025)
SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution
par: Ba, Zhongjie, et autres
Publié: (2023)
par: Ba, Zhongjie, et autres
Publié: (2023)
Towards Real-world Debiasing: Rethinking Evaluation, Challenge, and Solution
par: Kuang, Peng, et autres
Publié: (2024)
par: Kuang, Peng, et autres
Publié: (2024)
FINER: Enhancing State-of-the-art Classifiers with Feature Attribution to Facilitate Security Analysis
par: He, Yiling, et autres
Publié: (2023)
par: He, Yiling, et autres
Publié: (2023)
FedTracker: Furnishing Ownership Verification and Traceability for Federated Learning Model
par: Shao, Shuo, et autres
Publié: (2022)
par: Shao, Shuo, et autres
Publié: (2022)
A Survey on Medical Large Language Models: Technology, Application, Trustworthiness, and Future Directions
par: Liu, Lei, et autres
Publié: (2024)
par: Liu, Lei, et autres
Publié: (2024)
JANUS: Anatomy-Conditioned Gating for Robust CT Triage Under Distribution Shift
par: Dahal, Lavsen, et autres
Publié: (2026)
par: Dahal, Lavsen, et autres
Publié: (2026)
TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-Resolution
par: He, Haodong, et autres
Publié: (2026)
par: He, Haodong, et autres
Publié: (2026)
SoK: Large Language Model Copyright Auditing via Fingerprinting
par: Shao, Shuo, et autres
Publié: (2025)
par: Shao, Shuo, et autres
Publié: (2025)
JANUS: A Dual-Constraint Generative Framework for Stealthy Node Injection Attacks
par: Zhang, Jiahao, et autres
Publié: (2025)
par: Zhang, Jiahao, et autres
Publié: (2025)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
par: Weng, Jiaqi, et autres
Publié: (2025)
par: Weng, Jiaqi, et autres
Publié: (2025)
JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
par: Zhou, Yuxuan, et autres
Publié: (2025)
par: Zhou, Yuxuan, et autres
Publié: (2025)
Lightweight Facial Attractiveness Prediction Using Dual Label Distribution
par: Liu, Shu, et autres
Publié: (2022)
par: Liu, Shu, et autres
Publié: (2022)
FDINet: Protecting against DNN Model Extraction via Feature Distortion Index
par: Yao, Hongwei, et autres
Publié: (2023)
par: Yao, Hongwei, et autres
Publié: (2023)
Mitigating Social Bias in Large Language Models: A Multi-Objective Approach within a Multi-Agent Framework
par: Xu, Zhenjie, et autres
Publié: (2024)
par: Xu, Zhenjie, et autres
Publié: (2024)
Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation
par: Ren, Zhiyao, et autres
Publié: (2025)
par: Ren, Zhiyao, et autres
Publié: (2025)
Combating Concept Drift with Explanatory Detection and Adaptation for Android Malware Classification
par: He, Yiling, et autres
Publié: (2024)
par: He, Yiling, et autres
Publié: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
par: Liu, Jiayang, et autres
Publié: (2025)
par: Liu, Jiayang, et autres
Publié: (2025)
Formalization of Amicable Numbers Theory
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
Rethinking Data Protection in the (Generative) Artificial Intelligence Era
par: Li, Yiming, et autres
Publié: (2025)
par: Li, Yiming, et autres
Publié: (2025)
Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
par: Dong, Yingkai, et autres
Publié: (2024)
par: Dong, Yingkai, et autres
Publié: (2024)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
par: Yang, Zhuoran, et autres
Publié: (2025)
par: Yang, Zhuoran, et autres
Publié: (2025)
Documents similaires
-
MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
par: Chen, Tailun, et autres
Publié: (2025) -
Prompt-Consistency Image Generation (PCIG): A Unified Framework Integrating LLMs, Knowledge Graphs, and Controllable Diffusion Models
par: Sun, Yichen, et autres
Publié: (2024) -
MAJIC: Markovian Adaptive Jailbreaking via Iterative Composition of Diverse Innovative Strategies
par: Qi, Weiwei, et autres
Publié: (2025) -
Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets
par: Yang, Yuchen, et autres
Publié: (2026) -
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
par: Chu, Zhixuan, et autres
Publié: (2024)