Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yuanhe, Xie, Fangzhou, Zhou, Zhenhong, Li, Zherui, Chen, Hao, Wang, Kun, Guo, Yufei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
by: Li, Zherui, et al.
Published: (2025)
by: Li, Zherui, et al.
Published: (2025)
CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language Models
by: Zhou, Zhenhong, et al.
Published: (2025)
by: Zhou, Zhenhong, et al.
Published: (2025)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2026)
by: Zhang, Wei, et al.
Published: (2026)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
Resource Consumption Threats in Large Language Models
by: Zhang, Yuanhe, et al.
Published: (2026)
by: Zhang, Yuanhe, et al.
Published: (2026)
Reinforced Lifelong Editing for Language Models
by: Li, Zherui, et al.
Published: (2025)
by: Li, Zherui, et al.
Published: (2025)
Resource Consumption Red-Teaming for Large Vision-Language Models
by: Gao, Haoran, et al.
Published: (2025)
by: Gao, Haoran, et al.
Published: (2025)
$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models
by: Zhang, Yuanhe, et al.
Published: (2025)
by: Zhang, Yuanhe, et al.
Published: (2025)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Multimodal Conditioned Diffusive Time Series Forecasting
by: Su, Chen, et al.
Published: (2025)
by: Su, Chen, et al.
Published: (2025)
On the Role of Attention Heads in Large Language Model Safety
by: Zhou, Zhenhong, et al.
Published: (2024)
by: Zhou, Zhenhong, et al.
Published: (2024)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
by: Gao, Lang, et al.
Published: (2024)
by: Gao, Lang, et al.
Published: (2024)
Differences in Text Generated by Diffusion and Autoregressive Language Models
by: Zhang, Zeyang, et al.
Published: (2026)
by: Zhang, Zeyang, et al.
Published: (2026)
Energy-Based Diffusion Language Models for Text Generation
by: Xu, Minkai, et al.
Published: (2024)
by: Xu, Minkai, et al.
Published: (2024)
DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Goal-Aware Identification and Rectification of Misinformation in Multi-Agent Systems
by: Li, Zherui, et al.
Published: (2025)
by: Li, Zherui, et al.
Published: (2025)
Contrastive Learning for Knowledge-Based Question Generation in Large Language Models
by: Zhang, Zhenhong, et al.
Published: (2024)
by: Zhang, Zhenhong, et al.
Published: (2024)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
by: Wang, Chenglin, et al.
Published: (2026)
by: Wang, Chenglin, et al.
Published: (2026)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
by: Wang, Kun, et al.
Published: (2026)
by: Wang, Kun, et al.
Published: (2026)
Biased or Flawed? Mitigating Stereotypes in Generative Language Models by Addressing Task-Specific Flaws
by: Jha, Akshita, et al.
Published: (2024)
by: Jha, Akshita, et al.
Published: (2024)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
by: Jiang, Yilei, et al.
Published: (2025)
by: Jiang, Yilei, et al.
Published: (2025)
Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models
by: Chen, Jie, et al.
Published: (2024)
by: Chen, Jie, et al.
Published: (2024)
HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models
by: Zhao, Guoshenghui, et al.
Published: (2026)
by: Zhao, Guoshenghui, et al.
Published: (2026)
Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models
by: Li, Jiahui, et al.
Published: (2024)
by: Li, Jiahui, et al.
Published: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
by: Lin, Liang, et al.
Published: (2025)
by: Lin, Liang, et al.
Published: (2025)
Reversible Diffusion Decoding for Diffusion Language Models
by: Wang, Xinyun, et al.
Published: (2026)
by: Wang, Xinyun, et al.
Published: (2026)
Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support
by: Wu, Xiaojun, et al.
Published: (2024)
by: Wu, Xiaojun, et al.
Published: (2024)
Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model
by: Wang, Zhongzheng, et al.
Published: (2026)
by: Wang, Zhongzheng, et al.
Published: (2026)
Diversity Helps Jailbreak Large Language Models
by: Zhao, Weiliang, et al.
Published: (2024)
by: Zhao, Weiliang, et al.
Published: (2024)
Fusing Large Language Models with Temporal Transformers for Time Series Forecasting
by: Su, Chen, et al.
Published: (2025)
by: Su, Chen, et al.
Published: (2025)
Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models
by: Pernisi, Fabio, et al.
Published: (2024)
by: Pernisi, Fabio, et al.
Published: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
by: Li, Yifan, et al.
Published: (2024)
by: Li, Yifan, et al.
Published: (2024)
LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
by: Zhang, Yuanhe, et al.
Published: (2025)
by: Zhang, Yuanhe, et al.
Published: (2025)
Large Language Diffusion Models
by: Nie, Shen, et al.
Published: (2025)
by: Nie, Shen, et al.
Published: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
by: Yu, Miao, et al.
Published: (2024)
by: Yu, Miao, et al.
Published: (2024)
Lost in Diffusion: Uncovering Hallucination Patterns and Failure Modes in Diffusion Large Language Models
by: Guo, Zhengnan, et al.
Published: (2026)
by: Guo, Zhengnan, et al.
Published: (2026)
MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents
by: Zhou, Zhenhong, et al.
Published: (2026)
by: Zhou, Zhenhong, et al.
Published: (2026)
SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention
by: Wu, Jiaqi, et al.
Published: (2025)
by: Wu, Jiaqi, et al.
Published: (2025)
Multilingual Jailbreak Challenges in Large Language Models
by: Deng, Yue, et al.
Published: (2023)
by: Deng, Yue, et al.
Published: (2023)
Similar Items
-
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
by: Li, Zherui, et al.
Published: (2025) -
CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language Models
by: Zhou, Zhenhong, et al.
Published: (2025) -
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
by: Zhou, Zhenhong, et al.
Published: (2024) -
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
by: Zhang, Wei, et al.
Published: (2026) -
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
by: Zhou, Zhenhong, et al.
Published: (2024)