E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Liming, Gu, Xiang, Pang, Shuchao, Liang, Siyuan, Zhu, Haotian, Zeng, Xiyu, Zheng, Xu, Zhou, Yongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
di: Zeng, Xiyu, et al.
Pubblicazione: (2025)
di: Zeng, Xiyu, et al.
Pubblicazione: (2025)
Multimodal Robust Prompt Distillation for 3D Point Cloud Models
di: Gu, Xiang, et al.
Pubblicazione: (2025)
di: Gu, Xiang, et al.
Pubblicazione: (2025)
Towards a 3D Transfer-based Black-box Attack via Critical Feature Guidance
di: Pang, Shuchao, et al.
Pubblicazione: (2025)
di: Pang, Shuchao, et al.
Pubblicazione: (2025)
FERD: Fairness-Enhanced Data-Free Robustness Distillation
di: Li, Zhengxiao, et al.
Pubblicazione: (2025)
di: Li, Zhengxiao, et al.
Pubblicazione: (2025)
RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation
di: Liu, Enguang, et al.
Pubblicazione: (2025)
di: Liu, Enguang, et al.
Pubblicazione: (2025)
CIARD: Cyclic Iterative Adversarial Robustness Distillation
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
di: Lu, Weikai, et al.
Pubblicazione: (2024)
di: Lu, Weikai, et al.
Pubblicazione: (2024)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
di: Ji, Haoxuan, et al.
Pubblicazione: (2024)
di: Ji, Haoxuan, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2025)
di: Zhao, Yunhan, et al.
Pubblicazione: (2025)
Jailbreaking Attack against Multimodal Large Language Model
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
DREAM: Dynamic Red-teaming across Environments for AI Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
di: Wang, Siyuan, et al.
Pubblicazione: (2024)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
Enhancing Content-based Recommendation via Large Language Model
di: Xu, Wentao, et al.
Pubblicazione: (2024)
di: Xu, Wentao, et al.
Pubblicazione: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
Jailbreaks on Vision Language Model via Multimodal Reasoning
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning
di: Liang, Siyuan, et al.
Pubblicazione: (2024)
di: Liang, Siyuan, et al.
Pubblicazione: (2024)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
di: Chen, Beitao, et al.
Pubblicazione: (2025)
di: Chen, Beitao, et al.
Pubblicazione: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models
di: Xu, Yue, et al.
Pubblicazione: (2024)
di: Xu, Yue, et al.
Pubblicazione: (2024)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
di: Hu, Xiangdong, et al.
Pubblicazione: (2026)
di: Hu, Xiangdong, et al.
Pubblicazione: (2026)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
di: Li, Chenxu, et al.
Pubblicazione: (2025)
di: Li, Chenxu, et al.
Pubblicazione: (2025)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
di: Jiang, Yilei, et al.
Pubblicazione: (2024)
di: Jiang, Yilei, et al.
Pubblicazione: (2024)
Reconstruction of Differentially Private Text Sanitization via Large Language Models
di: Pang, Shuchao, et al.
Pubblicazione: (2024)
di: Pang, Shuchao, et al.
Pubblicazione: (2024)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
di: Zeng, Xiyu, et al.
Pubblicazione: (2025) -
Multimodal Robust Prompt Distillation for 3D Point Cloud Models
di: Gu, Xiang, et al.
Pubblicazione: (2025) -
Towards a 3D Transfer-based Black-box Attack via Critical Feature Guidance
di: Pang, Shuchao, et al.
Pubblicazione: (2025) -
FERD: Fairness-Enhanced Data-Free Robustness Distillation
di: Li, Zhengxiao, et al.
Pubblicazione: (2025) -
RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation
di: Liu, Enguang, et al.
Pubblicazione: (2025)