MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Kaiyuan, Yang, Chenghao, Wen, Zhoufutu, Yuan, Sihang, Wang, Qiuyue, Huang, Chaoyi, Zhu, Guosheng, Wang, He, Lu, Huawenyu, Wen, Jianing, Jiao, Jianpeng, Luo, Lishu, Liu, Longxiang, Wu, Sijin, Zhu, Xiaolei, Zhang, Xuanliang, Liu, Yu, Zhang, Ge, Lin, Yi, Shi, Guang, Fu, Chaoyou, Huang, Wenhao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
by: Yang, Chenghao, et al.
Published: (2025)
by: Yang, Chenghao, et al.
Published: (2025)
FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning
by: Hu, Liang, et al.
Published: (2025)
by: Hu, Liang, et al.
Published: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
by: Gan, Ziliang, et al.
Published: (2024)
by: Gan, Ziliang, et al.
Published: (2024)
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
by: Wang, Zhaowei, et al.
Published: (2026)
by: Wang, Zhaowei, et al.
Published: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)
by: Xie, Wulin, et al.
Published: (2025)
When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors
by: Yang, Chenghao, et al.
Published: (2026)
by: Yang, Chenghao, et al.
Published: (2026)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
by: Zhang, Yi-Fan, et al.
Published: (2024)
by: Zhang, Yi-Fan, et al.
Published: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
by: Cai, Yuxuan, et al.
Published: (2025)
by: Cai, Yuxuan, et al.
Published: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
by: Yuan, Jiakang, et al.
Published: (2025)
by: Yuan, Jiakang, et al.
Published: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
by: Shi, Yang, et al.
Published: (2025)
by: Shi, Yang, et al.
Published: (2025)
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
by: Zhao, Xiying, et al.
Published: (2025)
by: Zhao, Xiying, et al.
Published: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
by: Liu, Yuansen, et al.
Published: (2025)
by: Liu, Yuansen, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
by: Jiang, Dongzhi, et al.
Published: (2025)
by: Jiang, Dongzhi, et al.
Published: (2025)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
by: Ma, Kaijing, et al.
Published: (2024)
by: Ma, Kaijing, et al.
Published: (2024)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
by: Wei, Qianshan, et al.
Published: (2026)
by: Wei, Qianshan, et al.
Published: (2026)
FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation
by: Luo, Junyu, et al.
Published: (2025)
by: Luo, Junyu, et al.
Published: (2025)
CryptoX : Compositional Reasoning Evaluation of Large Language Models
by: Shi, Jiajun, et al.
Published: (2025)
by: Shi, Jiajun, et al.
Published: (2025)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
by: Zhang, Fan, et al.
Published: (2025)
by: Zhang, Fan, et al.
Published: (2025)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
by: Fu, Chaoyou, et al.
Published: (2026)
by: Fu, Chaoyou, et al.
Published: (2026)
PokerGPT: An End-to-End Lightweight Solver for Multi-Player Texas Hold'em via Large Language Model
by: Huang, Chenghao, et al.
Published: (2024)
by: Huang, Chenghao, et al.
Published: (2024)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQL
by: Wang, Dingzirui, et al.
Published: (2024)
by: Wang, Dingzirui, et al.
Published: (2024)
Scaling Laws for Agent Harnesses via Effective Feedback Compute
by: Zhang, Xuanliang, et al.
Published: (2026)
by: Zhang, Xuanliang, et al.
Published: (2026)
Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning Processes
by: Wang, Dingzirui, et al.
Published: (2024)
by: Wang, Dingzirui, et al.
Published: (2024)
DAC: Decomposed Automation Correction for Text-to-SQL
by: Wang, Dingzirui, et al.
Published: (2024)
by: Wang, Dingzirui, et al.
Published: (2024)
MURRE: Multi-Hop Table Retrieval with Removal for Open-Domain Text-to-SQL
by: Zhang, Xuanliang, et al.
Published: (2024)
by: Zhang, Xuanliang, et al.
Published: (2024)
How Do Language Models Understand Tables? A Mechanistic Analysis of Cell Location
by: Zhang, Xuanliang, et al.
Published: (2026)
by: Zhang, Xuanliang, et al.
Published: (2026)
Abacus-SQL: A Text-to-SQL System Empowering Cross-Domain and Open-Domain Database Retrieval
by: Xu, Keyan, et al.
Published: (2025)
by: Xu, Keyan, et al.
Published: (2025)
RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversals
by: Zhang, Xuanliang, et al.
Published: (2025)
by: Zhang, Xuanliang, et al.
Published: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
by: Zhang, Xuanliang, et al.
Published: (2025)
by: Zhang, Xuanliang, et al.
Published: (2025)
A Survey of Table Reasoning with Large Language Models
by: Zhang, Xuanliang, et al.
Published: (2024)
by: Zhang, Xuanliang, et al.
Published: (2024)
MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
by: Yi, Dongyi, et al.
Published: (2025)
by: Yi, Dongyi, et al.
Published: (2025)
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
by: Li, Siyi, et al.
Published: (2026)
by: Li, Siyi, et al.
Published: (2026)
Approaching Theoretical Capacity: 0D/2D Amorphous/Crystalline Bi‐Based Heterostructures Anode for Aqueous Alkaline Rechargeable Batteries
by: Xiaodong Wang, et al.
Published: (2024)
by: Xiaodong Wang, et al.
Published: (2024)
Mitochondrial permeability transition mediated by MTCH2 and F‐ ATP synthase contributes to ferroptosis defense
by: Lishu Guo
Published: (2024)
by: Lishu Guo
Published: (2024)
A Black-box Attack on Neural Networks Based on Swarm Evolutionary Algorithm
by: Liu, Xiaolei, et al.
Published: (2019)
by: Liu, Xiaolei, et al.
Published: (2019)
Sub‐1 nm High‐Entropy Materials for Electrochemical Applications
by: Qiuyue Chen, et al.
Published: (2026)
by: Qiuyue Chen, et al.
Published: (2026)
On the classification of lattice polytopes via affine equivalence
by: Cai, Zhanyuan, et al.
Published: (2024)
by: Cai, Zhanyuan, et al.
Published: (2024)
Similar Items
-
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
by: Yang, Chenghao, et al.
Published: (2025) -
FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning
by: Hu, Liang, et al.
Published: (2025) -
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
by: Gan, Ziliang, et al.
Published: (2024) -
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
by: Wang, Zhaowei, et al.
Published: (2026) -
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)