Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Ziyi, Cao, Yuanpu, Liu, Han, Wang, Ting, Chen, Jinghui, Ma, Fenhlong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
di: Cao, Bochuan, et al.
Pubblicazione: (2023)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
di: Yin, Ziyi, et al.
Pubblicazione: (2023)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
di: Liu, Aofan, et al.
Pubblicazione: (2025)
di: Liu, Aofan, et al.
Pubblicazione: (2025)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
di: Teng, Ma, et al.
Pubblicazione: (2024)
di: Teng, Ma, et al.
Pubblicazione: (2024)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2024)
di: Weng, Fenghua, et al.
Pubblicazione: (2024)
Watch the Watcher! Backdoor Attacks on Security-Enhancing Diffusion Models
di: Li, Changjiang, et al.
Pubblicazione: (2024)
di: Li, Changjiang, et al.
Pubblicazione: (2024)
Membership Inference Attacks Against Video Large Language Models
di: Song, Wei, et al.
Pubblicazione: (2026)
di: Song, Wei, et al.
Pubblicazione: (2026)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
di: Cao, Bochuan, et al.
Pubblicazione: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
di: Du, Mengyao, et al.
Pubblicazione: (2026)
di: Du, Mengyao, et al.
Pubblicazione: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
di: Song, Weiming, et al.
Pubblicazione: (2026)
di: Song, Weiming, et al.
Pubblicazione: (2026)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
FC-Attack: Jailbreaking Multimodal Large Language Models via Auto-Generated Flowcharts
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
di: Zhang, Ziyi, et al.
Pubblicazione: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models
di: Wang, Jackson
Pubblicazione: (2026)
di: Wang, Jackson
Pubblicazione: (2026)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
di: Wang, Yanting, et al.
Pubblicazione: (2025)
di: Wang, Yanting, et al.
Pubblicazione: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
di: Luo, Weidi, et al.
Pubblicazione: (2024)
di: Luo, Weidi, et al.
Pubblicazione: (2024)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
di: Cao, Bochuan, et al.
Pubblicazione: (2023) -
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023) -
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
di: Yin, Ziyi, et al.
Pubblicazione: (2023) -
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024) -
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)