BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Yunhan, Zheng, Xiang, Luo, Lin, Li, Yige, Ma, Xingjun, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
von: Li, Juncheng, et al.
Veröffentlicht: (2025)
von: Li, Juncheng, et al.
Veröffentlicht: (2025)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
Adversarial Prompt Distillation for Vision-Language Models
von: Luo, Lin, et al.
Veröffentlicht: (2024)
von: Luo, Lin, et al.
Veröffentlicht: (2024)
Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
von: Zhai, Kun, et al.
Veröffentlicht: (2025)
von: Zhai, Kun, et al.
Veröffentlicht: (2025)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
von: Song, Jiaxin, et al.
Veröffentlicht: (2025)
von: Song, Jiaxin, et al.
Veröffentlicht: (2025)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
von: Wang, Ruofan, et al.
Veröffentlicht: (2025)
AIM: Additional Image Guided Generation of Transferable Adversarial Attacks
von: Li, Teng, et al.
Veröffentlicht: (2025)
von: Li, Teng, et al.
Veröffentlicht: (2025)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
von: Wang, Xin, et al.
Veröffentlicht: (2025)
von: Wang, Xin, et al.
Veröffentlicht: (2025)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
Adversarial Prompt Tuning for Vision-Language Models
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2023)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
von: Huang, Hanxun, et al.
Veröffentlicht: (2025)
von: Huang, Hanxun, et al.
Veröffentlicht: (2025)
HoneypotNet: Backdoor Attacks Against Model Extraction
von: Wang, Yixu, et al.
Veröffentlicht: (2025)
von: Wang, Yixu, et al.
Veröffentlicht: (2025)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
BadPatch: Diffusion-Based Generation of Physical Adversarial Patches
von: Wang, Zhixiang, et al.
Veröffentlicht: (2024)
von: Wang, Zhixiang, et al.
Veröffentlicht: (2024)
Detecting Backdoor Samples in Contrastive Language Image Pretraining
von: Huang, Hanxun, et al.
Veröffentlicht: (2025)
von: Huang, Hanxun, et al.
Veröffentlicht: (2025)
TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models
von: Wang, Xin, et al.
Veröffentlicht: (2026)
von: Wang, Xin, et al.
Veröffentlicht: (2026)
Text is All You Need for Vision-Language Model Jailbreaking
von: Chen, Yihang, et al.
Veröffentlicht: (2026)
von: Chen, Yihang, et al.
Veröffentlicht: (2026)
AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning
von: Wang, Xin, et al.
Veröffentlicht: (2024)
von: Wang, Xin, et al.
Veröffentlicht: (2024)
Benchmarking Gaslighting Negation Attacks Against Reasoning Models
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
von: Li, Yige, et al.
Veröffentlicht: (2024)
von: Li, Yige, et al.
Veröffentlicht: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
von: Sun, Ye, et al.
Veröffentlicht: (2025)
von: Sun, Ye, et al.
Veröffentlicht: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
Jailbreaking Attack against Multimodal Large Language Model
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks
von: Xie, Peng, et al.
Veröffentlicht: (2024)
von: Xie, Peng, et al.
Veröffentlicht: (2024)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
von: Wu, Sihao, et al.
Veröffentlicht: (2025)
von: Wu, Sihao, et al.
Veröffentlicht: (2025)
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
Extracting Training Data from Unconditional Diffusion Models
von: Chen, Yunhao, et al.
Veröffentlicht: (2024)
von: Chen, Yunhao, et al.
Veröffentlicht: (2024)
Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2026)
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
von: Zhao, Yunhan, et al.
Veröffentlicht: (2025) -
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
von: Li, Jiayu, et al.
Veröffentlicht: (2025) -
White-box Multimodal Jailbreaks Against Large Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2024) -
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026) -
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
von: Li, Juncheng, et al.
Veröffentlicht: (2025)