GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zong, Yi, Qiu, Xipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025)
di: Li, Shilong, et al.
Pubblicazione: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
di: He, Zheqi, et al.
Pubblicazione: (2025)
di: He, Zheqi, et al.
Pubblicazione: (2025)
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
di: Lee, Sua, et al.
Pubblicazione: (2026)
di: Lee, Sua, et al.
Pubblicazione: (2026)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
di: Xue, Le, et al.
Pubblicazione: (2024)
di: Xue, Le, et al.
Pubblicazione: (2024)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
di: Zhang, Ge, et al.
Pubblicazione: (2024)
di: Zhang, Ge, et al.
Pubblicazione: (2024)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models
di: Lee, Segyu, et al.
Pubblicazione: (2026)
di: Lee, Segyu, et al.
Pubblicazione: (2026)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
LinguaMark: Do Multimodal Models Speak Fairly? A Benchmark-Based Evaluation
di: Raval, Ananya, et al.
Pubblicazione: (2025)
di: Raval, Ananya, et al.
Pubblicazione: (2025)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
di: Jian, Ai, et al.
Pubblicazione: (2025)
di: Jian, Ai, et al.
Pubblicazione: (2025)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification
di: Song, Ziyang, et al.
Pubblicazione: (2025)
di: Song, Ziyang, et al.
Pubblicazione: (2025)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
di: Wu, Yifan, et al.
Pubblicazione: (2024)
di: Wu, Yifan, et al.
Pubblicazione: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
di: Huang, Jinsheng, et al.
Pubblicazione: (2024)
di: Huang, Jinsheng, et al.
Pubblicazione: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
di: Zhao, Bingchen, et al.
Pubblicazione: (2024)
di: Zhao, Bingchen, et al.
Pubblicazione: (2024)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
di: Choi, Byungjin, et al.
Pubblicazione: (2026)
di: Choi, Byungjin, et al.
Pubblicazione: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
di: Chen, Qiguang, et al.
Pubblicazione: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
di: Zhang, Haowei, et al.
Pubblicazione: (2026)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
Benchmarking Multimodal Large Language Models for Face Recognition
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
di: Onohara, Shota, et al.
Pubblicazione: (2024)
di: Onohara, Shota, et al.
Pubblicazione: (2024)
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
di: Galarnyk, Michael, et al.
Pubblicazione: (2025)
di: Galarnyk, Michael, et al.
Pubblicazione: (2025)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
di: Ryan, Yuriel, et al.
Pubblicazione: (2025)
di: Ryan, Yuriel, et al.
Pubblicazione: (2025)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Prism: Spectral-Aware Block-Sparse Attention
di: Wang, Xinghao, et al.
Pubblicazione: (2026)
di: Wang, Xinghao, et al.
Pubblicazione: (2026)
Multimodal Fact-Level Attribution for Verifiable Reasoning
di: Wan, David, et al.
Pubblicazione: (2026)
di: Wan, David, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023) -
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024) -
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025) -
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
di: He, Zheqi, et al.
Pubblicazione: (2025) -
MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
di: Lee, Sua, et al.
Pubblicazione: (2026)