Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yu, Zhou, Xiaofei, Wang, Yichen, Zhang, Geyuan, He, Tianxing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025)
por: Jiang, Lei, et al.
Publicado: (2025)
NP-LoRA: Null Space Projection for Subject-Style LoRA Fusion
por: Chen, Chuheng, et al.
Publicado: (2025)
por: Chen, Chuheng, et al.
Publicado: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
por: Azulay, Aharon, et al.
Publicado: (2026)
por: Azulay, Aharon, et al.
Publicado: (2026)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
LaRe: Latent Refocusing for Multimodal Reasoning
por: Ma, Jizheng, et al.
Publicado: (2025)
por: Ma, Jizheng, et al.
Publicado: (2025)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
por: Song, Jiaxin, et al.
Publicado: (2025)
por: Song, Jiaxin, et al.
Publicado: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
por: Hao, Shuyang, et al.
Publicado: (2025)
por: Hao, Shuyang, et al.
Publicado: (2025)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
por: Liang, Shuang, et al.
Publicado: (2025)
por: Liang, Shuang, et al.
Publicado: (2025)
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
por: Huang, Qidong, et al.
Publicado: (2023)
por: Huang, Qidong, et al.
Publicado: (2023)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
por: Shi, Min, et al.
Publicado: (2025)
por: Shi, Min, et al.
Publicado: (2025)
VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models
por: Sima, Bingrui, et al.
Publicado: (2025)
por: Sima, Bingrui, et al.
Publicado: (2025)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
por: Wang, Dianyi, et al.
Publicado: (2025)
por: Wang, Dianyi, et al.
Publicado: (2025)
Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2025)
por: Wang, Ruofan, et al.
Publicado: (2025)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
por: Lv, Weiyi, et al.
Publicado: (2025)
por: Lv, Weiyi, et al.
Publicado: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
por: Zhu, Tinghui, et al.
Publicado: (2024)
por: Zhu, Tinghui, et al.
Publicado: (2024)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
por: Zhao, Han, et al.
Publicado: (2024)
por: Zhao, Han, et al.
Publicado: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
MultiModal Action Conditioned Video Generation
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models
por: Hao, Shuyang, et al.
Publicado: (2024)
por: Hao, Shuyang, et al.
Publicado: (2024)
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
por: Liang, Shuang, et al.
Publicado: (2025)
por: Liang, Shuang, et al.
Publicado: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
EAVL: Explicitly Align Vision and Language for Referring Image Segmentation
por: Yan, Yichen, et al.
Publicado: (2023)
por: Yan, Yichen, et al.
Publicado: (2023)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
por: Li, Shiyao, et al.
Publicado: (2024)
por: Li, Shiyao, et al.
Publicado: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
Evaluating Attribute Comprehension in Large Vision-Language Models
por: Zhang, Haiwen, et al.
Publicado: (2024)
por: Zhang, Haiwen, et al.
Publicado: (2024)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
por: Xin, Yi, et al.
Publicado: (2025)
por: Xin, Yi, et al.
Publicado: (2025)
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
por: Szu-Tu, Li-Zhong, et al.
Publicado: (2025)
por: Szu-Tu, Li-Zhong, et al.
Publicado: (2025)
Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models
por: Li, Yuanbo, et al.
Publicado: (2026)
por: Li, Yuanbo, et al.
Publicado: (2026)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
por: Shao, Zhenwei, et al.
Publicado: (2025)
por: Shao, Zhenwei, et al.
Publicado: (2025)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
por: Li, Qingyun, et al.
Publicado: (2025)
por: Li, Qingyun, et al.
Publicado: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
por: Xu, Runsen, et al.
Publicado: (2025)
por: Xu, Runsen, et al.
Publicado: (2025)
Ejemplares similares
-
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025) -
NP-LoRA: Null Space Projection for Subject-Style LoRA Fusion
por: Chen, Chuheng, et al.
Publicado: (2025) -
Jailbreaking Vision-Language Models Through the Visual Modality
por: Azulay, Aharon, et al.
Publicado: (2026) -
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024) -
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)