Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nagaraja, Neha, Zhang, Lan, Wang, Zhilong, Zhang, Bo, Patil, Pawan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
To Protect the LLM Agent Against the Prompt Injection Attack with Polymorphic Prompt
par: Wang, Zhilong, et autres
Publié: (2025)
par: Wang, Zhilong, et autres
Publié: (2025)
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
par: Fan, Zexin, et autres
Publié: (2024)
par: Fan, Zexin, et autres
Publié: (2024)
Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
par: Li, Changyue, et autres
Publié: (2025)
par: Li, Changyue, et autres
Publié: (2025)
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
par: Naseh, Ali, et autres
Publié: (2024)
par: Naseh, Ali, et autres
Publié: (2024)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Hijack-GAN: Unintended-Use of Pretrained, Black-Box GANs
par: Wang, Hui-Po, et autres
Publié: (2020)
par: Wang, Hui-Po, et autres
Publié: (2020)
Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction
par: Fu, Jiyuan, et autres
Publié: (2024)
par: Fu, Jiyuan, et autres
Publié: (2024)
Boosting Adversarial Transferability with Spatial Adversarial Alignment
par: Chen, Zhaoyu, et autres
Publié: (2025)
par: Chen, Zhaoyu, et autres
Publié: (2025)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
par: Xu, Wenzhuo, et autres
Publié: (2025)
par: Xu, Wenzhuo, et autres
Publié: (2025)
SLICE: Semantic Latent Injection via Compartmentalized Embedding for Image Watermarking
par: Gao, Zheng, et autres
Publié: (2026)
par: Gao, Zheng, et autres
Publié: (2026)
Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning
par: Yang, Ziqing, et autres
Publié: (2026)
par: Yang, Ziqing, et autres
Publié: (2026)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
par: Yin, Ziyi, et autres
Publié: (2023)
par: Yin, Ziyi, et autres
Publié: (2023)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
par: Zhang, Yitong, et autres
Publié: (2025)
par: Zhang, Yitong, et autres
Publié: (2025)
Modeling Electromagnetic Signal Injection Attacks on Camera-based Smart Systems: Applications and Mitigation
par: Zhang, Youqian, et autres
Publié: (2024)
par: Zhang, Youqian, et autres
Publié: (2024)
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
par: Miao, Ziqi, et autres
Publié: (2025)
par: Miao, Ziqi, et autres
Publié: (2025)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
par: Li, Xinfeng, et autres
Publié: (2025)
par: Li, Xinfeng, et autres
Publié: (2025)
BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents
par: Ma, Bo, et autres
Publié: (2026)
par: Ma, Bo, et autres
Publié: (2026)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
par: Zhang, Rui, et autres
Publié: (2025)
par: Zhang, Rui, et autres
Publié: (2025)
Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments
par: Zhang, Yitong, et autres
Publié: (2025)
par: Zhang, Yitong, et autres
Publié: (2025)
Generating Image Adversarial Examples by Embedding Digital Watermarks
par: Xiang, Yuexin, et autres
Publié: (2020)
par: Xiang, Yuexin, et autres
Publié: (2020)
Controllable Adversarial Makeup for Privacy via Text-Guided Diffusion
par: Kwon, Youngjin, et autres
Publié: (2025)
par: Kwon, Youngjin, et autres
Publié: (2025)
ZeroPur: Succinct Training-Free Adversarial Purification
par: Liu, Erhu, et autres
Publié: (2024)
par: Liu, Erhu, et autres
Publié: (2024)
Vulnerabilities in AI-generated Image Detection: The Challenge of Adversarial Attacks
par: Diao, Yunfeng, et autres
Publié: (2024)
par: Diao, Yunfeng, et autres
Publié: (2024)
Unrecognizable Yet Identifiable: Image Distortion with Preserved Embeddings
par: Zakharov, Dmytro, et autres
Publié: (2024)
par: Zakharov, Dmytro, et autres
Publié: (2024)
Understanding Impacts of Electromagnetic Signal Injection Attacks on Object Detection
par: Zhang, Youqian, et autres
Publié: (2024)
par: Zhang, Youqian, et autres
Publié: (2024)
Enhancing Adversarial Attacks: The Similar Target Method
par: Zhang, Shuo, et autres
Publié: (2023)
par: Zhang, Shuo, et autres
Publié: (2023)
SnatchML: Hijacking ML models without Training Access
par: Ghorbel, Mahmoud, et autres
Publié: (2024)
par: Ghorbel, Mahmoud, et autres
Publié: (2024)
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
par: Shao, Zedian, et autres
Publié: (2026)
par: Shao, Zedian, et autres
Publié: (2026)
Stealthy Multi-Task Adversarial Attacks
par: Guo, Jiacheng, et autres
Publié: (2024)
par: Guo, Jiacheng, et autres
Publié: (2024)
Are You Copying My Prompt? Protecting the Copyright of Vision Prompt for VPaaS via Watermark
par: Ren, Huali, et autres
Publié: (2024)
par: Ren, Huali, et autres
Publié: (2024)
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2026)
par: Liu, Renyang, et autres
Publié: (2026)
OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
TPatch: A Triggered Physical Adversarial Patch
par: Zhu, Wenjun, et autres
Publié: (2023)
par: Zhu, Wenjun, et autres
Publié: (2023)
Anomaly Unveiled: Securing Image Classification against Adversarial Patch Attacks
par: Chattopadhyay, Nandish, et autres
Publié: (2024)
par: Chattopadhyay, Nandish, et autres
Publié: (2024)
Time Traveling to Defend Against Adversarial Example Attacks in Image Classification
par: Etim, Anthony, et autres
Publié: (2024)
par: Etim, Anthony, et autres
Publié: (2024)
R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning
par: Sheng, Lijun, et autres
Publié: (2025)
par: Sheng, Lijun, et autres
Publié: (2025)
Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach
par: Huang, Linhao, et autres
Publié: (2025)
par: Huang, Linhao, et autres
Publié: (2025)
Documents similaires
-
To Protect the LLM Agent Against the Prompt Injection Attack with Polymorphic Prompt
par: Wang, Zhilong, et autres
Publié: (2025) -
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
par: Fan, Zexin, et autres
Publié: (2024) -
Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
par: Li, Changyue, et autres
Publié: (2025) -
Iteratively Prompting Multimodal LLMs to Reproduce Natural and AI-Generated Images
par: Naseh, Ali, et autres
Publié: (2024) -
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
par: Guo, Ji, et autres
Publié: (2024)