Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Rui Yang, Hu, Yujia, Lee, Roy Ka-Wei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
by: Chen, Jiangong, et al.
Published: (2026)
by: Chen, Jiangong, et al.
Published: (2026)
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
by: Wen, Jinming, et al.
Published: (2025)
by: Wen, Jinming, et al.
Published: (2025)
Watermarking Visual Concepts for Diffusion Models
by: Lei, Liangqi, et al.
Published: (2024)
by: Lei, Liangqi, et al.
Published: (2024)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
by: Huang, Xijie, et al.
Published: (2024)
by: Huang, Xijie, et al.
Published: (2024)
The Synthetic Media Shift: Tracking the Rise, Virality, and Detectability of AI-Generated Multimodal Misinformation
by: Chrysidis, Zacharias, et al.
Published: (2026)
by: Chrysidis, Zacharias, et al.
Published: (2026)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
by: Lu, Weikai, et al.
Published: (2025)
by: Lu, Weikai, et al.
Published: (2025)
Optimization-Free Universal Watermark Forgery with Regenerative Diffusion Models
by: Zhu, Chaoyi, et al.
Published: (2025)
by: Zhu, Chaoyi, et al.
Published: (2025)
MaXsive: High-Capacity and Robust Training-Free Generative Image Watermarking in Diffusion Models
by: Mao, Po-Yuan, et al.
Published: (2025)
by: Mao, Po-Yuan, et al.
Published: (2025)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Steganography in Game Actions
by: Chang, Ching-Chun, et al.
Published: (2024)
by: Chang, Ching-Chun, et al.
Published: (2024)
Steganography Beyond Space-Time with Chain of Multimodal AI
by: Chang, Ching-Chun, et al.
Published: (2025)
by: Chang, Ching-Chun, et al.
Published: (2025)
Multimodal Reasoning with LLM for Encrypted Traffic Interpretation: A Benchmark
by: Zhang, Longgang, et al.
Published: (2026)
by: Zhang, Longgang, et al.
Published: (2026)
An Undetectable Watermark for Generative Image Models
by: Gunn, Sam, et al.
Published: (2024)
by: Gunn, Sam, et al.
Published: (2024)
Multi-Modal Multi-Task Federated Foundation Models for Next-Generation Extended Reality Systems: Towards Privacy-Preserving Distributed Intelligence in AR/VR/MR
by: Nadimi, Fardis, et al.
Published: (2025)
by: Nadimi, Fardis, et al.
Published: (2025)
Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations
by: Kumar, Divyanshu, et al.
Published: (2025)
by: Kumar, Divyanshu, et al.
Published: (2025)
On the Origin of Synthetic Information by Means of Steganographic Inheritance
by: Chang, Ching-Chun, et al.
Published: (2026)
by: Chang, Ching-Chun, et al.
Published: (2026)
Adaptive Prototype Knowledge Transfer for Federated Learning with Mixed Modalities and Heterogeneous Tasks
by: Gai, Keke, et al.
Published: (2025)
by: Gai, Keke, et al.
Published: (2025)
TimeWak: Temporal Chained-Hashing Watermark for Time Series Data
by: Soi, Zhi Wen, et al.
Published: (2025)
by: Soi, Zhi Wen, et al.
Published: (2025)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
by: Chen, Guangke, et al.
Published: (2025)
by: Chen, Guangke, et al.
Published: (2025)
Multimodal Unlearnable Examples: Protecting Data against Multimodal Contrastive Learning
by: Liu, Xinwei, et al.
Published: (2024)
by: Liu, Xinwei, et al.
Published: (2024)
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
by: Zheng, Baolin, et al.
Published: (2025)
by: Zheng, Baolin, et al.
Published: (2025)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
by: Zhang, Deyue, et al.
Published: (2025)
by: Zhang, Deyue, et al.
Published: (2025)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
by: Chen, Renmiao, et al.
Published: (2025)
by: Chen, Renmiao, et al.
Published: (2025)
TrafficMoE: Heterogeneity-aware Mixture of Experts for Encrypted Traffic Classification
by: He, Qing, et al.
Published: (2026)
by: He, Qing, et al.
Published: (2026)
Mean Masked Autoencoder with Flow-Mixing for Encrypted Traffic Classification
by: Liu, Xiao, et al.
Published: (2026)
by: Liu, Xiao, et al.
Published: (2026)
Blind Data Adaptation to tackle Covariate Shift in Operational Steganalysis
by: Abecidan, Rony, et al.
Published: (2024)
by: Abecidan, Rony, et al.
Published: (2024)
RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System
by: Choudhury, Nitin, et al.
Published: (2026)
by: Choudhury, Nitin, et al.
Published: (2026)
Intelligent Carrier Allocation: A Cross-Modal Reasoning Framework for Adaptive Multimodal Steganography
by: Das, Abhirup, et al.
Published: (2025)
by: Das, Abhirup, et al.
Published: (2025)
VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative Models
by: Li, Xiang, et al.
Published: (2023)
by: Li, Xiang, et al.
Published: (2023)
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
by: Lu, Weikai, et al.
Published: (2025)
by: Lu, Weikai, et al.
Published: (2025)
MarkDiffusion: An Open-Source Toolkit for Generative Watermarking of Latent Diffusion Models
by: Pan, Leyi, et al.
Published: (2025)
by: Pan, Leyi, et al.
Published: (2025)
MaskAnyone Toolkit: Offering Strategies for Minimizing Privacy Risks and Maximizing Utility in Audio-Visual Data Archiving
by: Owoyele, Babajide Alamu, et al.
Published: (2024)
by: Owoyele, Babajide Alamu, et al.
Published: (2024)
Privis: Towards Content-Aware Secure Volumetric Video Delivery
by: Hu, Kaiyuan, et al.
Published: (2025)
by: Hu, Kaiyuan, et al.
Published: (2025)
TGIF2: Extended Text-Guided Inpainting Forgery Dataset & Benchmark
by: Mareen, Hannes, et al.
Published: (2026)
by: Mareen, Hannes, et al.
Published: (2026)
TGIF: Text-Guided Inpainting Forgery Dataset
by: Mareen, Hannes, et al.
Published: (2024)
by: Mareen, Hannes, et al.
Published: (2024)
SafeEar: Content Privacy-Preserving Audio Deepfake Detection
by: Li, Xinfeng, et al.
Published: (2024)
by: Li, Xinfeng, et al.
Published: (2024)
Is It Really You? Exploring Biometric Verification Scenarios in Photorealistic Talking-Head Avatar Videos
by: Pedrouzo-Rodriguez, Laura, et al.
Published: (2025)
by: Pedrouzo-Rodriguez, Laura, et al.
Published: (2025)
SWIFT: Semantic Watermarking for Image Forgery Thwarting
by: Evennou, Gautier, et al.
Published: (2024)
by: Evennou, Gautier, et al.
Published: (2024)
Security Analysis of Thumbnail-Preserving Image Encryption and a New Framework
by: Xie, Dong, et al.
Published: (2025)
by: Xie, Dong, et al.
Published: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
by: Huang, Tiansheng, et al.
Published: (2024)
by: Huang, Tiansheng, et al.
Published: (2024)
Similar Items
-
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
by: Chen, Jiangong, et al.
Published: (2026) -
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
by: Wen, Jinming, et al.
Published: (2025) -
Watermarking Visual Concepts for Diffusion Models
by: Lei, Liangqi, et al.
Published: (2024) -
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
by: Huang, Xijie, et al.
Published: (2024) -
The Synthetic Media Shift: Tracking the Rise, Virality, and Detectability of AI-Generated Multimodal Misinformation
by: Chrysidis, Zacharias, et al.
Published: (2026)