Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wei, Zhihua, Li, Qiang, Ruan, Jian, Qin, Zhenxin, Wen, Leilei, Liu, Dongrui, Shen, Wen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
von: Qin, Zhenxin, et al.
Veröffentlicht: (2026)
von: Qin, Zhenxin, et al.
Veröffentlicht: (2026)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
von: Yu, Mingyu, et al.
Veröffentlicht: (2026)
von: Yu, Mingyu, et al.
Veröffentlicht: (2026)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
von: Yin, Xiangyu, et al.
Veröffentlicht: (2025)
von: Yin, Xiangyu, et al.
Veröffentlicht: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
von: Lee, Wonjun, et al.
Veröffentlicht: (2025)
von: Lee, Wonjun, et al.
Veröffentlicht: (2025)
Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization
von: Lan, Yuqin, et al.
Veröffentlicht: (2026)
von: Lan, Yuqin, et al.
Veröffentlicht: (2026)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning
von: Sun, Penglei, et al.
Veröffentlicht: (2025)
von: Sun, Penglei, et al.
Veröffentlicht: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
von: Wu, Sihao, et al.
Veröffentlicht: (2025)
von: Wu, Sihao, et al.
Veröffentlicht: (2025)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity
von: Li, Zuoou, et al.
Veröffentlicht: (2025)
von: Li, Zuoou, et al.
Veröffentlicht: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts
von: Kim, Hee-Seon, et al.
Veröffentlicht: (2025)
von: Kim, Hee-Seon, et al.
Veröffentlicht: (2025)
X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability
von: Lu, Xiaoya, et al.
Veröffentlicht: (2025)
von: Lu, Xiaoya, et al.
Veröffentlicht: (2025)
Antelope: Potent and Concealed Jailbreak Attack Strategy
von: Zhao, Xin, et al.
Veröffentlicht: (2024)
von: Zhao, Xin, et al.
Veröffentlicht: (2024)
MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs
von: Liu, Yilian, et al.
Veröffentlicht: (2026)
von: Liu, Yilian, et al.
Veröffentlicht: (2026)
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
von: Hou, Jiacheng, et al.
Veröffentlicht: (2026)
von: Hou, Jiacheng, et al.
Veröffentlicht: (2026)
AdCare-VLM: Towards a Unified and Pre-aligned Latent Representation for Healthcare Video Understanding
von: Jabin, Md Asaduzzaman, et al.
Veröffentlicht: (2025)
von: Jabin, Md Asaduzzaman, et al.
Veröffentlicht: (2025)
PuFace: Defending against Facial Cloaking Attacks for Facial Recognition Models
von: Wen, Jing
Veröffentlicht: (2024)
von: Wen, Jing
Veröffentlicht: (2024)
Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment
von: Song, Zhixue, et al.
Veröffentlicht: (2026)
von: Song, Zhixue, et al.
Veröffentlicht: (2026)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
EgoVLM: Policy Optimization for Egocentric Video Understanding
von: Vinod, Ashwin, et al.
Veröffentlicht: (2025)
von: Vinod, Ashwin, et al.
Veröffentlicht: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
Multimodal Pragmatic Jailbreak on Text-to-image Models
von: Liu, Tong, et al.
Veröffentlicht: (2024)
von: Liu, Tong, et al.
Veröffentlicht: (2024)
Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
von: Wen, Ziqi, et al.
Veröffentlicht: (2026)
von: Wen, Ziqi, et al.
Veröffentlicht: (2026)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
Text is All You Need for Vision-Language Model Jailbreaking
von: Chen, Yihang, et al.
Veröffentlicht: (2026)
von: Chen, Yihang, et al.
Veröffentlicht: (2026)
Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization
von: He, Mengqi, et al.
Veröffentlicht: (2026)
von: He, Mengqi, et al.
Veröffentlicht: (2026)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
von: Liu, Hanqing, et al.
Veröffentlicht: (2026)
von: Liu, Hanqing, et al.
Veröffentlicht: (2026)
Domain Adaptation of VLM for Soccer Video Understanding
von: Jiang, Tiancheng, et al.
Veröffentlicht: (2025)
von: Jiang, Tiancheng, et al.
Veröffentlicht: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
von: Chen, Pingyi, et al.
Veröffentlicht: (2025)
von: Chen, Pingyi, et al.
Veröffentlicht: (2025)
Vision-Enhanced Time Series Forecasting via Latent Diffusion Models
von: Ruan, Weilin, et al.
Veröffentlicht: (2025)
von: Ruan, Weilin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Mitigating Action-Relation Hallucinations in LVLMs via Relation-aware Visual Enhancement
von: Qin, Zhenxin, et al.
Veröffentlicht: (2026) -
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
von: Wang, Han, et al.
Veröffentlicht: (2024) -
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
von: Yu, Mingyu, et al.
Veröffentlicht: (2026) -
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024) -
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
von: Yin, Xiangyu, et al.
Veröffentlicht: (2025)