Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Chongxin, Wang, Hanzhang, Duan, Lian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2026)
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2026)
TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
von: Zou, Quanchen, et al.
Veröffentlicht: (2026)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
von: Shi, Liang, et al.
Veröffentlicht: (2024)
von: Shi, Liang, et al.
Veröffentlicht: (2024)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
von: Song, Jiaxin, et al.
Veröffentlicht: (2025)
von: Song, Jiaxin, et al.
Veröffentlicht: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Leveraging Computational Pathology AI for Noninvasive Optical Imaging Analysis Without Retraining
von: Barash, Danny, et al.
Veröffentlicht: (2024)
von: Barash, Danny, et al.
Veröffentlicht: (2024)
Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
von: Wei, Zhihua, et al.
Veröffentlicht: (2026)
von: Wei, Zhihua, et al.
Veröffentlicht: (2026)
MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations
von: Wu, Jiang, et al.
Veröffentlicht: (2025)
von: Wu, Jiang, et al.
Veröffentlicht: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
Self-Improving VLM Judges Without Human Annotations
von: Lin, Inna Wanyin, et al.
Veröffentlicht: (2025)
von: Lin, Inna Wanyin, et al.
Veröffentlicht: (2025)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
von: Liu, Zhendong, et al.
Veröffentlicht: (2024)
Similarity-Aware Token Pruning: Your VLM but Faster
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
von: Yi, Huahui, et al.
Veröffentlicht: (2025)
von: Yi, Huahui, et al.
Veröffentlicht: (2025)
MGFFD-VLM: Multi-Granularity Prompt Learning for Face Forgery Detection with VLM
von: Chen, Tao, et al.
Veröffentlicht: (2025)
von: Chen, Tao, et al.
Veröffentlicht: (2025)
One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
von: Balakrishnan, Ravikumar, et al.
Veröffentlicht: (2026)
von: Balakrishnan, Ravikumar, et al.
Veröffentlicht: (2026)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
von: Zhang, Yitong, et al.
Veröffentlicht: (2025)
von: Zhang, Yitong, et al.
Veröffentlicht: (2025)
GridPrune: From "Where to Look" to "What to Select" in Visual Token Pruning for MLLMs
von: Duan, Yuxiang, et al.
Veröffentlicht: (2025)
von: Duan, Yuxiang, et al.
Veröffentlicht: (2025)
Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment
von: Song, Zhixue, et al.
Veröffentlicht: (2026)
von: Song, Zhixue, et al.
Veröffentlicht: (2026)
Benchmarking and Enhancing VLM for Compressed Image Understanding
von: Zhang, Zifu, et al.
Veröffentlicht: (2025)
von: Zhang, Zifu, et al.
Veröffentlicht: (2025)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
von: Wu, Zhenkai, et al.
Veröffentlicht: (2025)
von: Wu, Zhenkai, et al.
Veröffentlicht: (2025)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
von: Lyu, Weimin, et al.
Veröffentlicht: (2024)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
Enhancing Autonomous Driving Safety with Collision Scenario Integration
von: Wang, Zi, et al.
Veröffentlicht: (2025)
von: Wang, Zi, et al.
Veröffentlicht: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
von: Liu, Jianyu, et al.
Veröffentlicht: (2025)
Steganographic Passport: An Owner and User Verifiable Credential for Deep Model IP Protection Without Retraining
von: Cui, Qi, et al.
Veröffentlicht: (2024)
von: Cui, Qi, et al.
Veröffentlicht: (2024)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
von: Weng, Charles, et al.
Veröffentlicht: (2026)
von: Weng, Charles, et al.
Veröffentlicht: (2026)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
von: Bhat, Mohammad Qazim, et al.
Veröffentlicht: (2026)
von: Bhat, Mohammad Qazim, et al.
Veröffentlicht: (2026)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
von: Liu, Qin, et al.
Veröffentlicht: (2025)
von: Liu, Qin, et al.
Veröffentlicht: (2025)
Anyone Can Jailbreak: Prompt-Based Attacks on LLMs and T2Is
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2025)
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2025)
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts
von: Liu, Xu, et al.
Veröffentlicht: (2024)
von: Liu, Xu, et al.
Veröffentlicht: (2024)
iKUN: Speak to Trackers without Retraining
von: Du, Yunhao, et al.
Veröffentlicht: (2023)
von: Du, Yunhao, et al.
Veröffentlicht: (2023)
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
von: Peng, Xingkai, et al.
Veröffentlicht: (2025)
von: Peng, Xingkai, et al.
Veröffentlicht: (2025)
Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons
von: Zhang, Xianhui, et al.
Veröffentlicht: (2026)
von: Zhang, Xianhui, et al.
Veröffentlicht: (2026)
Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification
von: Sriram, Ananth, et al.
Veröffentlicht: (2026)
von: Sriram, Ananth, et al.
Veröffentlicht: (2026)
Can Better Text Semantics in Prompt Tuning Improve VLM Generalization?
von: Kuchibhotla, Hari Chandana, et al.
Veröffentlicht: (2024)
von: Kuchibhotla, Hari Chandana, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
von: Mustafa, Ahmed B, et al.
Veröffentlicht: (2026) -
TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
von: Zou, Quanchen, et al.
Veröffentlicht: (2026) -
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
von: Shi, Liang, et al.
Veröffentlicht: (2024) -
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
von: Song, Jiaxin, et al.
Veröffentlicht: (2025) -
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025)