MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yuhao, Liao, Yusheng, Liu, Heyang, Liu, Hongcheng, Wang, Yu, Wang, Yanfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator
par: Liao, Yusheng, et autres
Publié: (2024)
par: Liao, Yusheng, et autres
Publié: (2024)
Med-PMC: Medical Personalized Multi-modal Consultation with a Proactive Ask-First-Observe-Next Paradigm
par: Liu, Hongcheng, et autres
Publié: (2024)
par: Liu, Hongcheng, et autres
Publié: (2024)
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
par: Jin, Yiqiao, et autres
Publié: (2024)
par: Jin, Yiqiao, et autres
Publié: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
par: Xu, Mengya, et autres
Publié: (2025)
par: Xu, Mengya, et autres
Publié: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
par: Ou, Siqu, et autres
Publié: (2025)
par: Ou, Siqu, et autres
Publié: (2025)
VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency
par: Liu, Hongcheng, et autres
Publié: (2025)
par: Liu, Hongcheng, et autres
Publié: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models
par: Xia, Haotian, et autres
Publié: (2024)
par: Xia, Haotian, et autres
Publié: (2024)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025)
par: Li, Shilong, et autres
Publié: (2025)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
par: Ruan, Jiacheng, et autres
Publié: (2025)
par: Ruan, Jiacheng, et autres
Publié: (2025)
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
par: Huang, Yipo, et autres
Publié: (2024)
par: Huang, Yipo, et autres
Publié: (2024)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
par: Qi, Ji, et autres
Publié: (2023)
par: Qi, Ji, et autres
Publié: (2023)
Decoding Linguistic Representations of Human Brain
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
par: Chen, Liang, et autres
Publié: (2024)
par: Chen, Liang, et autres
Publié: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
par: Deng, Yihe, et autres
Publié: (2024)
par: Deng, Yihe, et autres
Publié: (2024)
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
par: Li, Jian, et autres
Publié: (2024)
par: Li, Jian, et autres
Publié: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2025)
par: Wang, Zekun, et autres
Publié: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023)
par: Chen, Yi, et autres
Publié: (2023)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
par: Nie, Yiqi, et autres
Publié: (2026)
par: Nie, Yiqi, et autres
Publié: (2026)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
par: Liu, Shaonan, et autres
Publié: (2026)
par: Liu, Shaonan, et autres
Publié: (2026)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
par: Liu, Xin, et autres
Publié: (2023)
par: Liu, Xin, et autres
Publié: (2023)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
par: Zhang, Zefeng, et autres
Publié: (2025)
par: Zhang, Zefeng, et autres
Publié: (2025)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
par: Xue, Le, et autres
Publié: (2024)
par: Xue, Le, et autres
Publié: (2024)
Documents similaires
-
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
par: Wang, Yuhao, et autres
Publié: (2024) -
Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator
par: Liao, Yusheng, et autres
Publié: (2024) -
Med-PMC: Medical Personalized Multi-modal Consultation with a Proactive Ask-First-Observe-Next Paradigm
par: Liu, Hongcheng, et autres
Publié: (2024) -
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
par: Jin, Yiqiao, et autres
Publié: (2024) -
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
par: Xu, Mengya, et autres
Publié: (2025)