Safety of Multimodal Large Language Models on Images and Texts
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xin, Zhu, Yichen, Lan, Yunshi, Yang, Chao, Qiao, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
di: Huang, Yu, et al.
Pubblicazione: (2025)
di: Huang, Yu, et al.
Pubblicazione: (2025)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025)
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
di: Meng, Chutian, et al.
Pubblicazione: (2024)
di: Meng, Chutian, et al.
Pubblicazione: (2024)
VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model
di: Yang, Jinze, et al.
Pubblicazione: (2024)
di: Yang, Jinze, et al.
Pubblicazione: (2024)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
di: Peng, Jihua, et al.
Pubblicazione: (2025)
di: Peng, Jihua, et al.
Pubblicazione: (2025)
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
di: Gou, Yunhao, et al.
Pubblicazione: (2024)
di: Gou, Yunhao, et al.
Pubblicazione: (2024)
SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2025)
di: Chen, Junkai, et al.
Pubblicazione: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025)
di: Fu, Pei, et al.
Pubblicazione: (2025)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
di: Peng, Xingkai, et al.
Pubblicazione: (2025)
di: Peng, Xingkai, et al.
Pubblicazione: (2025)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
di: Wang, Weizhi, et al.
Pubblicazione: (2024)
di: Wang, Weizhi, et al.
Pubblicazione: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
di: Liu, Jianyu, et al.
Pubblicazione: (2025)
Urban Safety Perception Assessments via Integrating Multimodal Large Language Models with Street View Images
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
di: Liu, Dongyang, et al.
Pubblicazione: (2024)
di: Liu, Dongyang, et al.
Pubblicazione: (2024)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models
di: Luo, Katie, et al.
Pubblicazione: (2025)
di: Luo, Katie, et al.
Pubblicazione: (2025)
Multimodal Large Language Models as Image Classifiers
di: Kisel, Nikita, et al.
Pubblicazione: (2026)
di: Kisel, Nikita, et al.
Pubblicazione: (2026)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
LDGen: Enhancing Text-to-Image Synthesis via Large Language Model-Driven Language Representation
di: Li, Pengzhi, et al.
Pubblicazione: (2025)
di: Li, Pengzhi, et al.
Pubblicazione: (2025)
Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardiac MR-Based Applications
di: Tang, Yucheng, et al.
Pubblicazione: (2025)
di: Tang, Yucheng, et al.
Pubblicazione: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
di: Wen, Junjie, et al.
Pubblicazione: (2025)
di: Wen, Junjie, et al.
Pubblicazione: (2025)
FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
di: Wang, Hongyang, et al.
Pubblicazione: (2025)
di: Wang, Hongyang, et al.
Pubblicazione: (2025)
Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
di: Liu, Zhaochen, et al.
Pubblicazione: (2025)
di: Liu, Zhaochen, et al.
Pubblicazione: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2023)
di: Fu, Tsu-Jui, et al.
Pubblicazione: (2023)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
di: Li, Xiujun, et al.
Pubblicazione: (2023)
di: Li, Xiujun, et al.
Pubblicazione: (2023)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models
di: Shi, Yichen, et al.
Pubblicazione: (2024)
di: Shi, Yichen, et al.
Pubblicazione: (2024)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
VP-LLM: Text-Driven 3D Volume Completion with Large Language Models through Patchification
di: Liu, Jianmeng, et al.
Pubblicazione: (2024)
di: Liu, Jianmeng, et al.
Pubblicazione: (2024)
Large Language Models for Multimodal Deformable Image Registration
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
di: Ma, Mingrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023) -
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
di: Sun, Tao, et al.
Pubblicazione: (2025) -
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
di: Huang, Yu, et al.
Pubblicazione: (2025) -
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
di: Wang, Hanqing, et al.
Pubblicazione: (2025) -
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2025)