Text is All You Need for Vision-Language Model Jailbreaking
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Yihang, Xu, Zhao, Jiang, Youyuan, Zheng, Tianle, Hsieh, Cho-Jui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
por: Liang, Shuang, et al.
Publicado: (2025)
por: Liang, Shuang, et al.
Publicado: (2025)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
Metaphor-based Jailbreak Attacks on Text-to-Image Models
por: Zhang, Chenyu, et al.
Publicado: (2025)
por: Zhang, Chenyu, et al.
Publicado: (2025)
Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
por: Zhang, Chenyu, et al.
Publicado: (2025)
por: Zhang, Chenyu, et al.
Publicado: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
por: Liu, Tong, et al.
Publicado: (2024)
por: Liu, Tong, et al.
Publicado: (2024)
Antelope: Potent and Concealed Jailbreak Attack Strategy
por: Zhao, Xin, et al.
Publicado: (2024)
por: Zhao, Xin, et al.
Publicado: (2024)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
por: Chen, Moyang, et al.
Publicado: (2026)
por: Chen, Moyang, et al.
Publicado: (2026)
MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?
por: Li, Xirui, et al.
Publicado: (2024)
por: Li, Xirui, et al.
Publicado: (2024)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
por: Hao, Shuyang, et al.
Publicado: (2025)
por: Hao, Shuyang, et al.
Publicado: (2025)
Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards
por: Yan, Song, et al.
Publicado: (2025)
por: Yan, Song, et al.
Publicado: (2025)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
por: Gao, Sensen, et al.
Publicado: (2024)
por: Gao, Sensen, et al.
Publicado: (2024)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
por: Liu, Jiangtao, et al.
Publicado: (2025)
por: Liu, Jiangtao, et al.
Publicado: (2025)
When Data-Free Knowledge Distillation Meets Non-Transferable Teacher: Escaping Out-of-Distribution Trap is All You Need
por: Hong, Ziming, et al.
Publicado: (2025)
por: Hong, Ziming, et al.
Publicado: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Failures to Find Transferable Image Jailbreaks Between Vision-Language Models
por: Schaeffer, Rylan, et al.
Publicado: (2024)
por: Schaeffer, Rylan, et al.
Publicado: (2024)
Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking
por: Chen, Junxi, et al.
Publicado: (2025)
por: Chen, Junxi, et al.
Publicado: (2025)
MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs
por: Liu, Yilian, et al.
Publicado: (2026)
por: Liu, Yilian, et al.
Publicado: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
Membership Inference Attacks against Large Vision-Language Models
por: Li, Zhan, et al.
Publicado: (2024)
por: Li, Zhan, et al.
Publicado: (2024)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
por: Zhang, Rui, et al.
Publicado: (2025)
por: Zhang, Rui, et al.
Publicado: (2025)
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
por: Pu, Jiayue, et al.
Publicado: (2026)
por: Pu, Jiayue, et al.
Publicado: (2026)
VideoEraser: Concept Erasure in Text-to-Video Diffusion Models
por: Xu, Naen, et al.
Publicado: (2025)
por: Xu, Naen, et al.
Publicado: (2025)
AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models
por: Li, Yue, et al.
Publicado: (2026)
por: Li, Yue, et al.
Publicado: (2026)
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
por: Zou, Quanchen, et al.
Publicado: (2025)
por: Zou, Quanchen, et al.
Publicado: (2025)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
por: Xu, Wenzhuo, et al.
Publicado: (2025)
por: Xu, Wenzhuo, et al.
Publicado: (2025)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
por: Zhang, Xinwei, et al.
Publicado: (2026)
por: Zhang, Xinwei, et al.
Publicado: (2026)
Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models
por: Zheng, Ziwei, et al.
Publicado: (2025)
por: Zheng, Ziwei, et al.
Publicado: (2025)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
por: Zhang, Ziyi, et al.
Publicado: (2025)
por: Zhang, Ziyi, et al.
Publicado: (2025)
Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion
por: Xie, Chunlong, et al.
Publicado: (2025)
por: Xie, Chunlong, et al.
Publicado: (2025)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
por: Zhang, Hongxiang, et al.
Publicado: (2024)
por: Zhang, Hongxiang, et al.
Publicado: (2024)
When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems
por: Zhao, Shiqian, et al.
Publicado: (2025)
por: Zhao, Shiqian, et al.
Publicado: (2025)
Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?
por: Amebley, David, et al.
Publicado: (2025)
por: Amebley, David, et al.
Publicado: (2025)
CopyrightMeter: Revisiting Copyright Protection in Text-to-image Models
por: Xu, Naen, et al.
Publicado: (2024)
por: Xu, Naen, et al.
Publicado: (2024)
Test-Time Attention Purification for Backdoored Large Vision Language Models
por: Zhang, Zhifang, et al.
Publicado: (2026)
por: Zhang, Zhifang, et al.
Publicado: (2026)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
por: Hu, Yuepeng, et al.
Publicado: (2025)
por: Hu, Yuepeng, et al.
Publicado: (2025)
Understanding Implosion in Text-to-Image Generative Models
por: Ding, Wenxin, et al.
Publicado: (2024)
por: Ding, Wenxin, et al.
Publicado: (2024)
Watertox: The Art of Simplicity in Universal Attacks A Cross-Model Framework for Robust Adversarial Generation
por: Gao, Zhenghao, et al.
Publicado: (2024)
por: Gao, Zhenghao, et al.
Publicado: (2024)
Ejemplares similares
-
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
por: Liang, Shuang, et al.
Publicado: (2025) -
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025) -
Metaphor-based Jailbreak Attacks on Text-to-Image Models
por: Zhang, Chenyu, et al.
Publicado: (2025) -
Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything
por: Zou, Xiaotian, et al.
Publicado: (2024) -
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)