Refusing Safe Prompts for Multi-modal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shao, Zedian, Liu, Hongbin, Hu, Yuepeng, Gong, Neil Zhenqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
von: Shao, Zedian, et al.
Veröffentlicht: (2026)
von: Shao, Zedian, et al.
Veröffentlicht: (2026)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
von: Liu, Zhongye, et al.
Veröffentlicht: (2024)
von: Liu, Zhongye, et al.
Veröffentlicht: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
von: Shao, Zedian, et al.
Veröffentlicht: (2024)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
von: Hu, Yuepeng, et al.
Veröffentlicht: (2025)
von: Hu, Yuepeng, et al.
Veröffentlicht: (2025)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
Watermark-based Attribution of AI-Generated Content
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2024)
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2024)
VideoMarkBench: Benchmarking Robustness of Video Watermarking
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
Mudjacking: Patching Backdoor Vulnerabilities in Foundation Models
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
von: Liu, Hongbin, et al.
Veröffentlicht: (2024)
Securing Visually-Aware Recommender Systems: An Adversarial Image Reconstruction and Detection Framework
von: Yin, Minglei, et al.
Veröffentlicht: (2023)
von: Yin, Minglei, et al.
Veröffentlicht: (2023)
Visual Hallucinations of Multi-modal Large Language Models
von: Huang, Wen, et al.
Veröffentlicht: (2024)
von: Huang, Wen, et al.
Veröffentlicht: (2024)
WebInject: Prompt Injection Attack to Web Agents
von: Wang, Xilong, et al.
Veröffentlicht: (2025)
von: Wang, Xilong, et al.
Veröffentlicht: (2025)
EditTrack: Detecting and Attributing AI-assisted Image Editing
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)
Certifiably Robust Image Watermark
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2024)
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2024)
A Critical Evaluation of Defenses against Prompt Injection Attacks
von: Jia, Yuqi, et al.
Veröffentlicht: (2025)
von: Jia, Yuqi, et al.
Veröffentlicht: (2025)
CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning
von: Zhang, Jinghuai, et al.
Veröffentlicht: (2022)
von: Zhang, Jinghuai, et al.
Veröffentlicht: (2022)
Robustness of Vision Foundation Models to Common Perturbations
von: Liu, Hongbin, et al.
Veröffentlicht: (2026)
von: Liu, Hongbin, et al.
Veröffentlicht: (2026)
PromptLocate: Localizing Prompt Injection Attacks
von: Jia, Yuqi, et al.
Veröffentlicht: (2025)
von: Jia, Yuqi, et al.
Veröffentlicht: (2025)
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
von: Liu, Renyang, et al.
Veröffentlicht: (2026)
von: Liu, Renyang, et al.
Veröffentlicht: (2026)
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
von: Tian, Yuan, et al.
Veröffentlicht: (2026)
von: Tian, Yuan, et al.
Veröffentlicht: (2026)
Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
von: Zhao, Xin, et al.
Veröffentlicht: (2025)
von: Zhao, Xin, et al.
Veröffentlicht: (2025)
REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models
von: Zou, Yong, et al.
Veröffentlicht: (2026)
von: Zou, Yong, et al.
Veröffentlicht: (2026)
Tracing Back the Malicious Clients in Poisoning Attacks to Federated Learning
von: Jia, Yuqi, et al.
Veröffentlicht: (2024)
von: Jia, Yuqi, et al.
Veröffentlicht: (2024)
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
von: Hu, Yuepeng, et al.
Veröffentlicht: (2024)
von: Hu, Yuepeng, et al.
Veröffentlicht: (2024)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
von: Wang, Yanbo, et al.
Veröffentlicht: (2025)
Security Risk of Misalignment between Text and Image in Multi-modal Model
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images
von: Stein, Kyle, et al.
Veröffentlicht: (2024)
von: Stein, Kyle, et al.
Veröffentlicht: (2024)
DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
von: Sun, Ye, et al.
Veröffentlicht: (2026)
von: Sun, Ye, et al.
Veröffentlicht: (2026)
L-AutoDA: Leveraging Large Language Models for Automated Decision-based Adversarial Attacks
von: Guo, Ping, et al.
Veröffentlicht: (2024)
von: Guo, Ping, et al.
Veröffentlicht: (2024)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
von: Zhang, Xinwei, et al.
Veröffentlicht: (2026)
von: Zhang, Xinwei, et al.
Veröffentlicht: (2026)
MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?
von: Li, Xirui, et al.
Veröffentlicht: (2024)
von: Li, Xirui, et al.
Veröffentlicht: (2024)
MOS-Attack: A Scalable Multi-objective Adversarial Attack Framework
von: Guo, Ping, et al.
Veröffentlicht: (2025)
von: Guo, Ping, et al.
Veröffentlicht: (2025)
Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
von: Guan, Jiwei, et al.
Veröffentlicht: (2026)
von: Guan, Jiwei, et al.
Veröffentlicht: (2026)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
von: Zhang, Ziyi, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyi, et al.
Veröffentlicht: (2025)
PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models
von: Yuan, Lingzhi, et al.
Veröffentlicht: (2025)
von: Yuan, Lingzhi, et al.
Veröffentlicht: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
von: Zhao, Kaixiang, et al.
Veröffentlicht: (2025)
von: Zhao, Kaixiang, et al.
Veröffentlicht: (2025)
Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
AI-generated Image Detection: Passive or Watermark?
von: Guo, Moyang, et al.
Veröffentlicht: (2024)
von: Guo, Moyang, et al.
Veröffentlicht: (2024)
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
von: Pu, Jiayue, et al.
Veröffentlicht: (2026)
von: Pu, Jiayue, et al.
Veröffentlicht: (2026)
General Autonomous Cybersecurity Defense: Learning Robust Policies for Dynamic Topologies and Diverse Attackers
von: Ramamurthy, Arun, et al.
Veröffentlicht: (2025)
von: Ramamurthy, Arun, et al.
Veröffentlicht: (2025)
PLA: Prompt Learning Attack against Text-to-Image Generative Models
von: Lyu, Xinqi, et al.
Veröffentlicht: (2025)
von: Lyu, Xinqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
von: Shao, Zedian, et al.
Veröffentlicht: (2026) -
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
von: Liu, Zhongye, et al.
Veröffentlicht: (2024) -
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
von: Shao, Zedian, et al.
Veröffentlicht: (2024) -
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
von: Hu, Yuepeng, et al.
Veröffentlicht: (2025) -
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
von: Jiang, Zhengyuan, et al.
Veröffentlicht: (2025)