Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Shuang, Xu, Zhihao, Tao, Jialing, Xue, Hui, Wang, Xiting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025)
di: Liang, Shuang, et al.
Pubblicazione: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
di: Hou, Jiacheng, et al.
Pubblicazione: (2026)
di: Hou, Jiacheng, et al.
Pubblicazione: (2026)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2025)
di: Zhao, Yunhan, et al.
Pubblicazione: (2025)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
di: Tao, Xijia, et al.
Pubblicazione: (2024)
di: Tao, Xijia, et al.
Pubblicazione: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
di: Ho, Zhengyi, et al.
Pubblicazione: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
Physical Prompt Injection Attacks on Large Vision-Language Models
di: Ling, Chen, et al.
Pubblicazione: (2026)
di: Ling, Chen, et al.
Pubblicazione: (2026)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
di: Yin, Xiangyu, et al.
Pubblicazione: (2025)
di: Yin, Xiangyu, et al.
Pubblicazione: (2025)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
di: Wu, Sihao, et al.
Pubblicazione: (2025)
di: Wu, Sihao, et al.
Pubblicazione: (2025)
Text is All You Need for Vision-Language Model Jailbreaking
di: Chen, Yihang, et al.
Pubblicazione: (2026)
di: Chen, Yihang, et al.
Pubblicazione: (2026)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
di: Zhu, Younan, et al.
Pubblicazione: (2025)
di: Zhu, Younan, et al.
Pubblicazione: (2025)
LL-ICM: Image Compression for Low-level Machine Vision via Large Vision-Language Model
di: Xue, Yuan, et al.
Pubblicazione: (2024)
di: Xue, Yuan, et al.
Pubblicazione: (2024)
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
di: Yang, Yijun, et al.
Pubblicazione: (2025)
di: Yang, Yijun, et al.
Pubblicazione: (2025)
Large Vision-Language Models Get Lost in Attention
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion
di: Xie, Chunlong, et al.
Pubblicazione: (2025)
di: Xie, Chunlong, et al.
Pubblicazione: (2025)
Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
di: Huang, Han, et al.
Pubblicazione: (2024)
di: Huang, Han, et al.
Pubblicazione: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
di: Zhou, Andy, et al.
Pubblicazione: (2024)
di: Zhou, Andy, et al.
Pubblicazione: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
di: Ai, Wei, et al.
Pubblicazione: (2026)
di: Ai, Wei, et al.
Pubblicazione: (2026)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction
di: Tang, Hongyi, et al.
Pubblicazione: (2026)
di: Tang, Hongyi, et al.
Pubblicazione: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
di: Luo, Junwei, et al.
Pubblicazione: (2025)
di: Luo, Junwei, et al.
Pubblicazione: (2025)
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
di: Lu, Hui, et al.
Pubblicazione: (2025)
di: Lu, Hui, et al.
Pubblicazione: (2025)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
di: Liu, Han, et al.
Pubblicazione: (2026)
di: Liu, Han, et al.
Pubblicazione: (2026)
DL$^3$M: A Vision-to-Language Framework for Expert-Level Medical Reasoning through Deep Learning and Large Language Models
di: Hasan, Md. Najib, et al.
Pubblicazione: (2025)
di: Hasan, Md. Najib, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
di: Xu, Qipan, et al.
Pubblicazione: (2025)
di: Xu, Qipan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025) -
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
di: Wang, Ruofan, et al.
Pubblicazione: (2024) -
White-box Multimodal Jailbreaks Against Large Vision-Language Models
di: Wang, Ruofan, et al.
Pubblicazione: (2024) -
When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
di: Hou, Jiacheng, et al.
Pubblicazione: (2026) -
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
di: Hossain, Md Zarif, et al.
Pubblicazione: (2024)