MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yuan, Jiakang, Peng, Tianshuo, Jiang, Yilei, Lu, Yiting, Zhang, Renrui, Feng, Kaituo, Fu, Chaoyou, Chen, Tao, Bai, Lei, Zhang, Bo, Yue, Xiangyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
von: Gan, Ziliang, et al.
Veröffentlicht: (2024)
von: Gan, Ziliang, et al.
Veröffentlicht: (2024)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
von: Xie, Wulin, et al.
Veröffentlicht: (2025)
von: Xie, Wulin, et al.
Veröffentlicht: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
von: Guo, Ziyu, et al.
Veröffentlicht: (2025)
von: Guo, Ziyu, et al.
Veröffentlicht: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2023)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
von: Cheng, Ziming, et al.
Veröffentlicht: (2025)
von: Cheng, Ziming, et al.
Veröffentlicht: (2025)
Chimera: Improving Generalist Model with Domain-Specific Experts
von: Peng, Tianshuo, et al.
Veröffentlicht: (2024)
von: Peng, Tianshuo, et al.
Veröffentlicht: (2024)
OneThinker: All-in-one Reasoning Model for Image and Video
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation
von: Luo, Junyu, et al.
Veröffentlicht: (2025)
von: Luo, Junyu, et al.
Veröffentlicht: (2025)
OpenGame: Open Agentic Coding for Games
von: Jiang, Yilei, et al.
Veröffentlicht: (2026)
von: Jiang, Yilei, et al.
Veröffentlicht: (2026)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
von: Chen, Michael K., et al.
Veröffentlicht: (2025)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
von: Qi, Yu, et al.
Veröffentlicht: (2026)
von: Qi, Yu, et al.
Veröffentlicht: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
von: Ruan, Jiacheng, et al.
Veröffentlicht: (2025)
von: Ruan, Jiacheng, et al.
Veröffentlicht: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
von: Guo, Longteng, et al.
Veröffentlicht: (2026)
von: Guo, Longteng, et al.
Veröffentlicht: (2026)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
von: Liu, Yuansen, et al.
Veröffentlicht: (2025)
von: Liu, Yuansen, et al.
Veröffentlicht: (2025)
MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiyuan, et al.
Veröffentlicht: (2025)
Evaluating the Logical Reasoning Abilities of Large Reasoning Models
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
MSEarth: A Multimodal Benchmark for Earth Science Phenomenon Discovery with MLLMs
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
von: Zhang, Honglei, et al.
Veröffentlicht: (2026)
von: Zhang, Honglei, et al.
Veröffentlicht: (2026)
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
von: Tang, Yolo Y., et al.
Veröffentlicht: (2025)
von: Tang, Yolo Y., et al.
Veröffentlicht: (2025)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
von: Xu, Qiang, et al.
Veröffentlicht: (2026)
von: Xu, Qiang, et al.
Veröffentlicht: (2026)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
von: Xiao, Kelaiti, et al.
Veröffentlicht: (2025)
von: Xiao, Kelaiti, et al.
Veröffentlicht: (2025)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2024)
GeoFM: Enhancing Geometric Reasoning of MLLMs via Synthetic Data Generation through Formal Language
von: Zhang, Yuhao, et al.
Veröffentlicht: (2025)
von: Zhang, Yuhao, et al.
Veröffentlicht: (2025)
VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents
von: Zhao, Xunyi, et al.
Veröffentlicht: (2025)
von: Zhao, Xunyi, et al.
Veröffentlicht: (2025)
FairReason: Balancing Reasoning and Social Bias in MLLMs
von: Pan, Zhenyu, et al.
Veröffentlicht: (2025)
von: Pan, Zhenyu, et al.
Veröffentlicht: (2025)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Fan, et al.
Veröffentlicht: (2025)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
von: Feng, Kaituo, et al.
Veröffentlicht: (2026)
von: Feng, Kaituo, et al.
Veröffentlicht: (2026)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning
von: Yin, Yao, et al.
Veröffentlicht: (2026)
von: Yin, Yao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025) -
Video-R1: Reinforcing Video Reasoning in MLLMs
von: Feng, Kaituo, et al.
Veröffentlicht: (2025) -
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026) -
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025) -
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)