GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Yu, Zhang, Andi, Wang, Yi, Yang, Sibei, Wang, Wenjie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025)
par: Shi, Cheng, et autres
Publié: (2025)
Vision Transformers Need More Than Registers
par: Shi, Cheng, et autres
Publié: (2026)
par: Shi, Cheng, et autres
Publié: (2026)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
par: Yin, Xiangyu, et autres
Publié: (2025)
par: Yin, Xiangyu, et autres
Publié: (2025)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
par: Song, Jiaxin, et autres
Publié: (2025)
par: Song, Jiaxin, et autres
Publié: (2025)
Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2025)
par: Wang, Ruofan, et autres
Publié: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
par: Tang, Jiajin, et autres
Publié: (2026)
par: Tang, Jiajin, et autres
Publié: (2026)
Penalizing Boundary Activation for Object Completeness in Diffusion Models
par: Xu, Haoyang, et autres
Publié: (2025)
par: Xu, Haoyang, et autres
Publié: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
DiffV2IR: Visible-to-Infrared Diffusion Model via Vision-Language Understanding
par: Ran, Lingyan, et autres
Publié: (2025)
par: Ran, Lingyan, et autres
Publié: (2025)
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
par: Shi, Cheng, et autres
Publié: (2024)
par: Shi, Cheng, et autres
Publié: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
par: Wu, Sihao, et autres
Publié: (2025)
par: Wu, Sihao, et autres
Publié: (2025)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
par: Zhang, Yulin, et autres
Publié: (2025)
par: Zhang, Yulin, et autres
Publié: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
par: Jin, Haibo, et autres
Publié: (2024)
par: Jin, Haibo, et autres
Publié: (2024)
Compositional Kronecker Context Optimization for Vision-Language Models
par: Ding, Kun, et autres
Publié: (2024)
par: Ding, Kun, et autres
Publié: (2024)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
par: Liao, Qilin, et autres
Publié: (2025)
par: Liao, Qilin, et autres
Publié: (2025)
TransXNet: Learning Both Global and Local Dynamics with a Dual Dynamic Token Mixer for Visual Recognition
par: Lou, Meng, et autres
Publié: (2023)
par: Lou, Meng, et autres
Publié: (2023)
Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation
par: Dai, Qiyuan, et autres
Publié: (2024)
par: Dai, Qiyuan, et autres
Publié: (2024)
Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM
par: Dai, Qiyuan, et autres
Publié: (2025)
par: Dai, Qiyuan, et autres
Publié: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models
par: Yang, Zijin, et autres
Publié: (2026)
par: Yang, Zijin, et autres
Publié: (2026)
OmniFashion: Towards Generalist Fashion Intelligence via Multi-Task Vision-Language Learning
par: Yang, Zhengwei, et autres
Publié: (2026)
par: Yang, Zhengwei, et autres
Publié: (2026)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
par: Liang, Shuang, et autres
Publié: (2025)
par: Liang, Shuang, et autres
Publié: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
par: Yan, Ziang, et autres
Publié: (2024)
par: Yan, Ziang, et autres
Publié: (2024)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
par: Yu, Chunlin, et autres
Publié: (2024)
par: Yu, Chunlin, et autres
Publié: (2024)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
par: Zhang, Yulin, et autres
Publié: (2026)
par: Zhang, Yulin, et autres
Publié: (2026)
No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
par: Yang, Bin, et autres
Publié: (2025)
par: Yang, Bin, et autres
Publié: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
par: Noheria, Aarush, et autres
Publié: (2026)
par: Noheria, Aarush, et autres
Publié: (2026)
Towards Better Optimization For Listwise Preference in Diffusion Models
par: Bai, Jiamu, et autres
Publié: (2025)
par: Bai, Jiamu, et autres
Publié: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
par: Zeng, Lunbin, et autres
Publié: (2025)
par: Zeng, Lunbin, et autres
Publié: (2025)
JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation
par: Mia, Md Jueal, et autres
Publié: (2025)
par: Mia, Md Jueal, et autres
Publié: (2025)
Discffusion: Discriminative Diffusion Models as Few-shot Vision and Language Learners
par: He, Xuehai, et autres
Publié: (2023)
par: He, Xuehai, et autres
Publié: (2023)
Conceptual Codebook Learning for Vision-Language Models
par: Zhang, Yi, et autres
Publié: (2024)
par: Zhang, Yi, et autres
Publié: (2024)
Documents similaires
-
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
par: Wang, Yu, et autres
Publié: (2024) -
Vision Function Layer in Multimodal LLMs
par: Shi, Cheng, et autres
Publié: (2025) -
Vision Transformers Need More Than Registers
par: Shi, Cheng, et autres
Publié: (2026) -
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
par: Yin, Xiangyu, et autres
Publié: (2025) -
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
par: Song, Jiaxin, et autres
Publié: (2025)