A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ye, Mang, Rong, Xuankun, Huang, Wenke, Du, Bo, Yu, Nenghai, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
von: Rong, Xuankun, et al.
Veröffentlicht: (2025)
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
von: Li, Xiao, et al.
Veröffentlicht: (2026)
von: Li, Xiao, et al.
Veröffentlicht: (2026)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
von: Wei, Kang, et al.
Veröffentlicht: (2025)
von: Wei, Kang, et al.
Veröffentlicht: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
von: Guo, Yangyang, et al.
Veröffentlicht: (2024)
MIBench: A Comprehensive Framework for Benchmarking Model Inversion Attack and Defense
von: Qiu, Yixiang, et al.
Veröffentlicht: (2024)
von: Qiu, Yixiang, et al.
Veröffentlicht: (2024)
A Survey of Trojan Attacks and Defenses to Deep Neural Networks
von: Jin, Lingxin, et al.
Veröffentlicht: (2024)
von: Jin, Lingxin, et al.
Veröffentlicht: (2024)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
von: Zhong, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zhong, Zhiyuan, et al.
Veröffentlicht: (2025)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
von: Liang, Shuang, et al.
Veröffentlicht: (2025)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
von: Zhang, Yitong, et al.
Veröffentlicht: (2025)
von: Zhang, Yitong, et al.
Veröffentlicht: (2025)
Stego Battlefield: Evaluating Image Steganography Attacks and Steganalysis Defenses
von: Sun, Zhen, et al.
Veröffentlicht: (2026)
von: Sun, Zhen, et al.
Veröffentlicht: (2026)
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2025)
Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models
von: Wu, Zongyu, et al.
Veröffentlicht: (2025)
von: Wu, Zongyu, et al.
Veröffentlicht: (2025)
Time Is All It Takes: Spike-Retiming Attacks on Event-Driven Spiking Neural Networks
von: Yu, Yi, et al.
Veröffentlicht: (2026)
von: Yu, Yi, et al.
Veröffentlicht: (2026)
Beyond Vulnerabilities: A Survey of Adversarial Attacks as Both Threats and Defenses in Computer Vision Systems
von: Guo, Zhongliang, et al.
Veröffentlicht: (2025)
von: Guo, Zhongliang, et al.
Veröffentlicht: (2025)
Adversarial Attacks and Defenses on Text-to-Image Diffusion Models: A Survey
von: Zhang, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Chenyu, et al.
Veröffentlicht: (2024)
CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
von: Xu, Shuhan, et al.
Veröffentlicht: (2026)
von: Xu, Shuhan, et al.
Veröffentlicht: (2026)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
von: Jia, Xiaojun, et al.
Veröffentlicht: (2025)
MMCert: Provable Defense against Adversarial Attacks to Multi-modal Models
von: Wang, Yanting, et al.
Veröffentlicht: (2024)
von: Wang, Yanting, et al.
Veröffentlicht: (2024)
A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
von: Yang, Hao, et al.
Veröffentlicht: (2026)
von: Yang, Hao, et al.
Veröffentlicht: (2026)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
von: Ma, Xingjun, et al.
Veröffentlicht: (2025)
von: Ma, Xingjun, et al.
Veröffentlicht: (2025)
Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey
von: Zhang, Chiyu, et al.
Veröffentlicht: (2024)
von: Zhang, Chiyu, et al.
Veröffentlicht: (2024)
Bounding-box Watermarking: Defense against Model Extraction Attacks on Object Detectors
von: Koda, Satoru, et al.
Veröffentlicht: (2024)
von: Koda, Satoru, et al.
Veröffentlicht: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor
von: Wei, Shaokui, et al.
Veröffentlicht: (2024)
von: Wei, Shaokui, et al.
Veröffentlicht: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
von: Li, Jiayu, et al.
Veröffentlicht: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
von: Su, Yanghao, et al.
Veröffentlicht: (2024)
von: Su, Yanghao, et al.
Veröffentlicht: (2024)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
von: Zhou, Yihe, et al.
Veröffentlicht: (2025)
von: Zhou, Yihe, et al.
Veröffentlicht: (2025)
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
von: Xiang, Yuxiao, et al.
Veröffentlicht: (2025)
von: Xiang, Yuxiao, et al.
Veröffentlicht: (2025)
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models
von: Yang, Zijin, et al.
Veröffentlicht: (2024)
von: Yang, Zijin, et al.
Veröffentlicht: (2024)
Revisiting Data Auditing in Large Vision-Language Models
von: Zhu, Hongyu, et al.
Veröffentlicht: (2025)
von: Zhu, Hongyu, et al.
Veröffentlicht: (2025)
SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks
von: Zhang, Xin, et al.
Veröffentlicht: (2026)
von: Zhang, Xin, et al.
Veröffentlicht: (2026)
Survey on Adversarial Attack and Defense for Medical Image Analysis: Methods and Challenges
von: Dong, Junhao, et al.
Veröffentlicht: (2023)
von: Dong, Junhao, et al.
Veröffentlicht: (2023)
RenderBender: A Survey on Adversarial Attacks Using Differentiable Rendering
von: Hull, Matthew, et al.
Veröffentlicht: (2024)
von: Hull, Matthew, et al.
Veröffentlicht: (2024)
Robust Image Classification: Defensive Strategies against FGSM and PGD Adversarial Attacks
von: Waghela, Hetvi, et al.
Veröffentlicht: (2024)
von: Waghela, Hetvi, et al.
Veröffentlicht: (2024)
Nearest is Not Dearest: Towards Practical Defense against Quantization-conditioned Backdoor Attacks
von: Li, Boheng, et al.
Veröffentlicht: (2024)
von: Li, Boheng, et al.
Veröffentlicht: (2024)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
von: Rong, Xuankun, et al.
Veröffentlicht: (2025) -
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
von: Rong, Xuankun, et al.
Veröffentlicht: (2025) -
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
von: Li, Xiao, et al.
Veröffentlicht: (2026) -
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
von: Ying, Zonghao, et al.
Veröffentlicht: (2024) -
Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
von: Wei, Kang, et al.
Veröffentlicht: (2025)