Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
Fuente:
arXiv
Salvato in:
| Autori principali: | Qu, Yiting, Backes, Michael, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
di: Chu, Junjie, et al.
Pubblicazione: (2026)
di: Chu, Junjie, et al.
Pubblicazione: (2026)
Concept-Guided Backdoor Attack on Vision Language Models
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
di: Shen, Haoyu, et al.
Pubblicazione: (2025)
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios
di: Pu, Jiayue, et al.
Pubblicazione: (2026)
di: Pu, Jiayue, et al.
Pubblicazione: (2026)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing
di: Zhu, Hongguang, et al.
Pubblicazione: (2025)
di: Zhu, Hongguang, et al.
Pubblicazione: (2025)
NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
di: Wu, Yixin, et al.
Pubblicazione: (2023)
di: Wu, Yixin, et al.
Pubblicazione: (2023)
Membership Inference Attacks Against Vision-Language Models
di: Hu, Yuke, et al.
Pubblicazione: (2025)
di: Hu, Yuke, et al.
Pubblicazione: (2025)
Prompt Stealing Attacks Against Text-to-Image Generation Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images
di: Qu, Yiting, et al.
Pubblicazione: (2024)
di: Qu, Yiting, et al.
Pubblicazione: (2024)
Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models
di: Zhang, Xiaomei, et al.
Pubblicazione: (2026)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2026)
Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
di: Zhang, Yage, et al.
Pubblicazione: (2026)
di: Zhang, Yage, et al.
Pubblicazione: (2026)
The Security Threat of Compressed Projectors in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Seeing is Deceiving: Exploitation of Visual Pathways in Multi-Modal Language Models
di: Janowczyk, Pete, et al.
Pubblicazione: (2024)
di: Janowczyk, Pete, et al.
Pubblicazione: (2024)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?
di: Yang, Ruixin, et al.
Pubblicazione: (2026)
di: Yang, Ruixin, et al.
Pubblicazione: (2026)
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
di: Chu, Junjie, et al.
Pubblicazione: (2025)
di: Chu, Junjie, et al.
Pubblicazione: (2025)
Adversarial attacks against Modern Vision-Language Models
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Multi-PA: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
Towards Understanding Unsafe Video Generation
di: Pang, Yan, et al.
Pubblicazione: (2024)
di: Pang, Yan, et al.
Pubblicazione: (2024)
Breach By A Thousand Leaks: Unsafe Information Leakage in `Safe' AI Responses
di: Glukhov, David, et al.
Pubblicazione: (2024)
di: Glukhov, David, et al.
Pubblicazione: (2024)
$\texttt{ModSCAN}$: Measuring Stereotypical Bias in Large Vision-Language Models from Vision and Language Modalities
di: Jiang, Yukun, et al.
Pubblicazione: (2024)
di: Jiang, Yukun, et al.
Pubblicazione: (2024)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
di: Nian, Yi, et al.
Pubblicazione: (2025)
di: Nian, Yi, et al.
Pubblicazione: (2025)
Automated Post-Incident Policy Gap Analysis via Threat-Informed Evidence Mapping using Large Language Models
di: Oh, Huan Lin, et al.
Pubblicazione: (2026)
di: Oh, Huan Lin, et al.
Pubblicazione: (2026)
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
MixBridge: Heterogeneous Image-to-Image Backdoor Attack through Mixture of Schrödinger Bridges
di: Qin, Shixi, et al.
Pubblicazione: (2025)
di: Qin, Shixi, et al.
Pubblicazione: (2025)
"Humans welcome to observe": A First Look at the Agent Social Network Moltbook
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models
di: Yuan, Lingzhi, et al.
Pubblicazione: (2025)
di: Yuan, Lingzhi, et al.
Pubblicazione: (2025)
Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks
di: Chu, Junjie, et al.
Pubblicazione: (2026)
di: Chu, Junjie, et al.
Pubblicazione: (2026)
On the Feasibility of Using MultiModal LLMs to Execute AR Social Engineering Attacks
di: Bi, Ting, et al.
Pubblicazione: (2025)
di: Bi, Ting, et al.
Pubblicazione: (2025)
Unsafe LLM-Based Search: Quantitative Analysis and Mitigation of Safety Risks in AI Web Search
di: Luo, Zeren, et al.
Pubblicazione: (2025)
di: Luo, Zeren, et al.
Pubblicazione: (2025)
Distilling Lightweight Language Models for C/C++ Vulnerabilities
di: Wei, Zhiyuan, et al.
Pubblicazione: (2025)
di: Wei, Zhiyuan, et al.
Pubblicazione: (2025)
Large Language Models for Power System Security: A Novel Multi-Modal Approach for Anomaly Detection in Energy Management Systems
di: Zaboli, Aydin, et al.
Pubblicazione: (2025)
di: Zaboli, Aydin, et al.
Pubblicazione: (2025)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026) -
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
di: Chu, Junjie, et al.
Pubblicazione: (2026) -
Concept-Guided Backdoor Attack on Vision Language Models
di: Shen, Haoyu, et al.
Pubblicazione: (2025) -
Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation
di: Wang, Haoyu, et al.
Pubblicazione: (2024) -
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
di: Jiang, Yukun, et al.
Pubblicazione: (2026)