Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yichi, Huang, Yao, Wang, Yifan, Sun, Yitong, Liu, Chang, Zhao, Zhe, Fang, Zhengwei, Chen, Huanran, Yang, Xiao, Wei, Xingxing, Su, Hang, Dong, Yinpeng, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Unveiling the Basin-Like Loss Landscape in Large Language Models
by: Chen, Huanran, et al.
Published: (2025)
by: Chen, Huanran, et al.
Published: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
by: Huang, Yao, et al.
Published: (2025)
by: Huang, Yao, et al.
Published: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
by: Chen, Huanran, et al.
Published: (2023)
by: Chen, Huanran, et al.
Published: (2023)
Towards the Worst-case Robustness of Large Language Models
by: Chen, Huanran, et al.
Published: (2025)
by: Chen, Huanran, et al.
Published: (2025)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
by: Huang, Yao, et al.
Published: (2025)
by: Huang, Yao, et al.
Published: (2025)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
by: Huang, Yao, et al.
Published: (2025)
by: Huang, Yao, et al.
Published: (2025)
Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization
by: Zhang, Siyuan, et al.
Published: (2025)
by: Zhang, Siyuan, et al.
Published: (2025)
Scaling Laws for Black box Adversarial Attacks
by: Liu, Chuan, et al.
Published: (2024)
by: Liu, Chuan, et al.
Published: (2024)
A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents
by: Su, Hang, et al.
Published: (2025)
by: Su, Hang, et al.
Published: (2025)
Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models
by: Zhang, Siyuan, et al.
Published: (2026)
by: Zhang, Siyuan, et al.
Published: (2026)
Robust Classification via a Single Diffusion Model
by: Chen, Huanran, et al.
Published: (2023)
by: Chen, Huanran, et al.
Published: (2023)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
by: Chen, Huanran, et al.
Published: (2024)
by: Chen, Huanran, et al.
Published: (2024)
RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations
by: Li, Hanyu, et al.
Published: (2026)
by: Li, Hanyu, et al.
Published: (2026)
AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?
by: Ruan, Shouwei, et al.
Published: (2024)
by: Ruan, Shouwei, et al.
Published: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
by: Ruan, Shouwei, et al.
Published: (2024)
by: Ruan, Shouwei, et al.
Published: (2024)
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
by: Sun, Yitong, et al.
Published: (2025)
by: Sun, Yitong, et al.
Published: (2025)
Towards Transferable Targeted 3D Adversarial Attack in the Physical World
by: Huang, Yao, et al.
Published: (2023)
by: Huang, Yao, et al.
Published: (2023)
STAIR: Improving Safety Alignment with Introspective Reasoning
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Alignment Dynamics in LLM Fine-Tuning
by: Huang, Yuhan, et al.
Published: (2026)
by: Huang, Yuhan, et al.
Published: (2026)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
by: Huang, Zhuo, et al.
Published: (2023)
by: Huang, Zhuo, et al.
Published: (2023)
AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization
by: Chen, Jiawei, et al.
Published: (2024)
by: Chen, Jiawei, et al.
Published: (2024)
Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima
by: Chen, Huanran, et al.
Published: (2026)
by: Chen, Huanran, et al.
Published: (2026)
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
by: Wu, Chengcan, et al.
Published: (2025)
by: Wu, Chengcan, et al.
Published: (2025)
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
by: Zhu, Qihui, et al.
Published: (2026)
by: Zhu, Qihui, et al.
Published: (2026)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models
by: Miao, Yibo, et al.
Published: (2024)
by: Miao, Yibo, et al.
Published: (2024)
Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
by: Wu, Lingxuan, et al.
Published: (2024)
by: Wu, Lingxuan, et al.
Published: (2024)
BSPA: Exploring Black-box Stealthy Prompt Attacks against Image Generators
by: Tian, Yu, et al.
Published: (2024)
by: Tian, Yu, et al.
Published: (2024)
Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning
by: Wang, Youze, et al.
Published: (2023)
by: Wang, Youze, et al.
Published: (2023)
Embodied Laser Attack:Leveraging Scene Priors to Achieve Agent-based Robust Non-contact Attacks
by: Sun, Yitong, et al.
Published: (2023)
by: Sun, Yitong, et al.
Published: (2023)
Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
by: Zhai, Shengfang, et al.
Published: (2024)
by: Zhai, Shengfang, et al.
Published: (2024)
Evaluating and Mitigating Linguistic Discrimination in Large Language Models
by: Dong, Guoliang, et al.
Published: (2024)
by: Dong, Guoliang, et al.
Published: (2024)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
by: Kang, Caixin, et al.
Published: (2023)
by: Kang, Caixin, et al.
Published: (2023)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
by: Wei, Xingxing, et al.
Published: (2024)
by: Wei, Xingxing, et al.
Published: (2024)
Toward Availability Attacks in 3D Point Clouds
by: Zhu, Yifan, et al.
Published: (2024)
by: Zhu, Yifan, et al.
Published: (2024)
Why Do Unlearnable Examples Work: A Novel Perspective of Mutual Information
by: Zhu, Yifan, et al.
Published: (2026)
by: Zhu, Yifan, et al.
Published: (2026)
Evil Geniuses: Delving into the Safety of LLM-based Agents
by: Tian, Yu, et al.
Published: (2023)
by: Tian, Yu, et al.
Published: (2023)
Similar Items
-
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
by: Zhang, Yichi, et al.
Published: (2024) -
Unveiling the Basin-Like Loss Landscape in Large Language Models
by: Chen, Huanran, et al.
Published: (2025) -
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
by: Huang, Yao, et al.
Published: (2025) -
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
by: Yang, Xiao, et al.
Published: (2025) -
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
by: Chen, Huanran, et al.
Published: (2023)