MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yichi, Huang, Yao, Sun, Yitong, Liu, Chang, Zhao, Zhe, Fang, Zhengwei, Wang, Yifan, Chen, Huanran, Yang, Xiao, Wei, Xingxing, Su, Hang, Dong, Yinpeng, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
von: Yang, Xiao, et al.
Veröffentlicht: (2025)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
von: Huang, Yao, et al.
Veröffentlicht: (2025)
von: Huang, Yao, et al.
Veröffentlicht: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
von: Huang, Yao, et al.
Veröffentlicht: (2025)
von: Huang, Yao, et al.
Veröffentlicht: (2025)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
von: Huang, Yao, et al.
Veröffentlicht: (2025)
von: Huang, Yao, et al.
Veröffentlicht: (2025)
Scaling Laws for Black box Adversarial Attacks
von: Liu, Chuan, et al.
Veröffentlicht: (2024)
von: Liu, Chuan, et al.
Veröffentlicht: (2024)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
von: Wang, Youze, et al.
Veröffentlicht: (2025)
von: Wang, Youze, et al.
Veröffentlicht: (2025)
Towards Transferable Targeted 3D Adversarial Attack in the Physical World
von: Huang, Yao, et al.
Veröffentlicht: (2023)
von: Huang, Yao, et al.
Veröffentlicht: (2023)
Exploring the Generalizability of Factual Hallucination Mitigation via Enhancing Precise Knowledge Utilization
von: Zhang, Siyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Siyuan, et al.
Veröffentlicht: (2025)
Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models
von: Zhang, Siyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Siyuan, et al.
Veröffentlicht: (2026)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
von: Chen, Huanran, et al.
Veröffentlicht: (2024)
von: Chen, Huanran, et al.
Veröffentlicht: (2024)
Towards the Worst-case Robustness of Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
Unveiling the Basin-Like Loss Landscape in Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
STAIR: Improving Safety Alignment with Introspective Reasoning
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Robust Classification via a Single Diffusion Model
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
AutoBreach: Universal and Adaptive Jailbreaking with Efficient Wordplay-Guided Optimization
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
von: Ruan, Shouwei, et al.
Veröffentlicht: (2024)
von: Ruan, Shouwei, et al.
Veröffentlicht: (2024)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
von: Huang, Jinsheng, et al.
Veröffentlicht: (2024)
von: Huang, Jinsheng, et al.
Veröffentlicht: (2024)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
von: Huang, Zhuo, et al.
Veröffentlicht: (2023)
von: Huang, Zhuo, et al.
Veröffentlicht: (2023)
BSPA: Exploring Black-box Stealthy Prompt Attacks against Image Generators
von: Tian, Yu, et al.
Veröffentlicht: (2024)
von: Tian, Yu, et al.
Veröffentlicht: (2024)
FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
von: Hu, Tiansheng, et al.
Veröffentlicht: (2025)
von: Hu, Tiansheng, et al.
Veröffentlicht: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
Evil Geniuses: Delving into the Safety of LLM-based Agents
von: Tian, Yu, et al.
Veröffentlicht: (2023)
von: Tian, Yu, et al.
Veröffentlicht: (2023)
TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
von: Xiong, Zixin, et al.
Veröffentlicht: (2026)
AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?
von: Ruan, Shouwei, et al.
Veröffentlicht: (2024)
von: Ruan, Shouwei, et al.
Veröffentlicht: (2024)
Membership Inference on Text-to-Image Diffusion Models via Conditional Likelihood Discrepancy
von: Zhai, Shengfang, et al.
Veröffentlicht: (2024)
von: Zhai, Shengfang, et al.
Veröffentlicht: (2024)
A Survey on Autonomy-Induced Security Risks in Large Model-Based Agents
von: Su, Hang, et al.
Veröffentlicht: (2025)
von: Su, Hang, et al.
Veröffentlicht: (2025)
NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation
von: Sun, Yitong, et al.
Veröffentlicht: (2025)
von: Sun, Yitong, et al.
Veröffentlicht: (2025)
A Comprehensive Survey of Continual Learning: Theory, Method and Application
von: Wang, Liyuan, et al.
Veröffentlicht: (2023)
von: Wang, Liyuan, et al.
Veröffentlicht: (2023)
Toward Availability Attacks in 3D Point Clouds
von: Zhu, Yifan, et al.
Veröffentlicht: (2024)
von: Zhu, Yifan, et al.
Veröffentlicht: (2024)
TrustLLM: Trustworthiness in Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
FaceCat: Enhancing Face Recognition Security with a Unified Diffusion Model
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
von: Chen, Jiawei, et al.
Veröffentlicht: (2024)
Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches
von: Wu, Lingxuan, et al.
Veröffentlicht: (2024)
von: Wu, Lingxuan, et al.
Veröffentlicht: (2024)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
von: Xing, Shuo, et al.
Veröffentlicht: (2024)
Surveying Attitudinal Alignment Between Large Language Models Vs. Humans Towards 17 Sustainable Development Goals
von: Wu, Qingyang, et al.
Veröffentlicht: (2024)
von: Wu, Qingyang, et al.
Veröffentlicht: (2024)
RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
von: Zhang, Yichi, et al.
Veröffentlicht: (2025) -
MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments
von: Yang, Xiao, et al.
Veröffentlicht: (2025) -
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
von: Huang, Yao, et al.
Veröffentlicht: (2025) -
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
von: Huang, Yao, et al.
Veröffentlicht: (2025) -
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
von: Chen, Huanran, et al.
Veröffentlicht: (2023)