Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liang, Shuang, Xu, Zhihao, Weng, Jiaqi, Tao, Jialing, Xue, Hui, Wang, Xiting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025)
di: Liang, Shuang, et al.
Pubblicazione: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink
di: Wang, Yining, et al.
Pubblicazione: (2025)
di: Wang, Yining, et al.
Pubblicazione: (2025)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
di: Yan, Song, et al.
Pubblicazione: (2025)
di: Yan, Song, et al.
Pubblicazione: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
di: Ye, Mang, et al.
Pubblicazione: (2025)
di: Ye, Mang, et al.
Pubblicazione: (2025)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
di: Zhong, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhong, Zhiyuan, et al.
Pubblicazione: (2025)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
di: Chen, Moyang, et al.
Pubblicazione: (2026)
di: Chen, Moyang, et al.
Pubblicazione: (2026)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Jailbreaking Attack against Multimodal Large Language Model
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
Text is All You Need for Vision-Language Model Jailbreaking
di: Chen, Yihang, et al.
Pubblicazione: (2026)
di: Chen, Yihang, et al.
Pubblicazione: (2026)
Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models
di: Wu, Zongyu, et al.
Pubblicazione: (2025)
di: Wu, Zongyu, et al.
Pubblicazione: (2025)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024)
di: Gao, Sensen, et al.
Pubblicazione: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
Revisiting Data Auditing in Large Vision-Language Models
di: Zhu, Hongyu, et al.
Pubblicazione: (2025)
di: Zhu, Hongyu, et al.
Pubblicazione: (2025)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
di: Guo, Yangyang, et al.
Pubblicazione: (2024)
di: Guo, Yangyang, et al.
Pubblicazione: (2024)
Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion
di: Xie, Chunlong, et al.
Pubblicazione: (2025)
di: Xie, Chunlong, et al.
Pubblicazione: (2025)
A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Fusion is Not Enough: Single Modal Attacks on Fusion Models for 3D Object Detection
di: Cheng, Zhiyuan, et al.
Pubblicazione: (2023)
di: Cheng, Zhiyuan, et al.
Pubblicazione: (2023)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
Test-Time Attention Purification for Backdoored Large Vision Language Models
di: Zhang, Zhifang, et al.
Pubblicazione: (2026)
di: Zhang, Zhifang, et al.
Pubblicazione: (2026)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
di: Li, Jiayu, et al.
Pubblicazione: (2025)
di: Li, Jiayu, et al.
Pubblicazione: (2025)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
Megatron: Evasive Clean-Label Backdoor Attacks against Vision Transformer
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
di: Xu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Xu, Wenzhuo, et al.
Pubblicazione: (2025)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
Antelope: Potent and Concealed Jailbreak Attack Strategy
di: Zhao, Xin, et al.
Pubblicazione: (2024)
di: Zhao, Xin, et al.
Pubblicazione: (2024)
FIDAVL: Fake Image Detection and Attribution using Vision-Language Model
di: Keita, Mamadou, et al.
Pubblicazione: (2024)
di: Keita, Mamadou, et al.
Pubblicazione: (2024)
Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images
di: Stein, Kyle, et al.
Pubblicazione: (2024)
di: Stein, Kyle, et al.
Pubblicazione: (2024)
An Effective and Resilient Backdoor Attack Framework against Deep Neural Networks and Vision Transformers
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
PASTA: A Patch-Agnostic Twofold-Stealthy Backdoor Attack on Vision Transformers
di: Liu, Dazhuang, et al.
Pubblicazione: (2026)
di: Liu, Dazhuang, et al.
Pubblicazione: (2026)
CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
di: Xu, Shuhan, et al.
Pubblicazione: (2026)
di: Xu, Shuhan, et al.
Pubblicazione: (2026)
EO-VLM: VLM-Guided Energy Overload Attacks on Vision Models
di: Seo, Minjae, et al.
Pubblicazione: (2025)
di: Seo, Minjae, et al.
Pubblicazione: (2025)
Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey
di: Zhang, Chiyu, et al.
Pubblicazione: (2024)
di: Zhang, Chiyu, et al.
Pubblicazione: (2024)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
di: Zhang, Chenyu, et al.
Pubblicazione: (2025)
When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
Harnessing the Power of Large Vision Language Models for Synthetic Image Detection
di: Keita, Mamadou, et al.
Pubblicazione: (2024)
di: Keita, Mamadou, et al.
Pubblicazione: (2024)
MADation: Face Morphing Attack Detection with Foundation Models
di: Caldeira, Eduarda, et al.
Pubblicazione: (2025)
di: Caldeira, Eduarda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025) -
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024) -
Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink
di: Wang, Yining, et al.
Pubblicazione: (2025) -
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
di: Yan, Song, et al.
Pubblicazione: (2025) -
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
di: Ye, Mang, et al.
Pubblicazione: (2025)