Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yan, Qianqi, Fan, Yue, Li, Hongquan, Jiang, Shan, Zhao, Yang, Guan, Xinze, Kuo, Ching-Chen, Wang, Xin Eric |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs
von: Yan, Qianqi, et al.
Veröffentlicht: (2025)
von: Yan, Qianqi, et al.
Veröffentlicht: (2025)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
von: Yan, Qianqi, et al.
Veröffentlicht: (2026)
von: Yan, Qianqi, et al.
Veröffentlicht: (2026)
SUPERChem: A Multimodal Reasoning Benchmark in Chemistry
von: Zhao, Zehua, et al.
Veröffentlicht: (2025)
von: Zhao, Zehua, et al.
Veröffentlicht: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges
von: Wang, Clinton J., et al.
Veröffentlicht: (2025)
von: Wang, Clinton J., et al.
Veröffentlicht: (2025)
Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA
von: Yan, Qianqi, et al.
Veröffentlicht: (2024)
von: Yan, Qianqi, et al.
Veröffentlicht: (2024)
Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding
von: Fan, Yue, et al.
Veröffentlicht: (2024)
von: Fan, Yue, et al.
Veröffentlicht: (2024)
Multimodal Reasoning with Multimodal Knowledge Graph
von: Lee, Junlin, et al.
Veröffentlicht: (2024)
von: Lee, Junlin, et al.
Veröffentlicht: (2024)
GRIT: Teaching MLLMs to Think with Images
von: Fan, Yue, et al.
Veröffentlicht: (2025)
von: Fan, Yue, et al.
Veröffentlicht: (2025)
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
von: Chen, Jialin, et al.
Veröffentlicht: (2025)
von: Chen, Jialin, et al.
Veröffentlicht: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
von: Jiang, Yulun, et al.
Veröffentlicht: (2025)
von: Jiang, Yulun, et al.
Veröffentlicht: (2025)
BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning
von: Nguyen, Ha-Thanh, et al.
Veröffentlicht: (2025)
von: Nguyen, Ha-Thanh, et al.
Veröffentlicht: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination
von: Akter, Syeda Nahida, et al.
Veröffentlicht: (2024)
von: Akter, Syeda Nahida, et al.
Veröffentlicht: (2024)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
von: Jia, Boyu, et al.
Veröffentlicht: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
von: Li, Hengzhi, et al.
Veröffentlicht: (2025)
von: Li, Hengzhi, et al.
Veröffentlicht: (2025)
MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs
von: Roccabruna, Gabriel, et al.
Veröffentlicht: (2026)
von: Roccabruna, Gabriel, et al.
Veröffentlicht: (2026)
On Path to Multimodal Historical Reasoning: HistBench and HistAgent
von: Qiu, Jiahao, et al.
Veröffentlicht: (2025)
von: Qiu, Jiahao, et al.
Veröffentlicht: (2025)
Capabilities of GPT-5 on Multimodal Medical Reasoning
von: Wang, Shansong, et al.
Veröffentlicht: (2025)
von: Wang, Shansong, et al.
Veröffentlicht: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
von: Cai, Zhenyang, et al.
Veröffentlicht: (2025)
von: Cai, Zhenyang, et al.
Veröffentlicht: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
Reasoning about concepts with LLMs: Inconsistencies abound
von: Uceda-Sosa, Rosario, et al.
Veröffentlicht: (2024)
von: Uceda-Sosa, Rosario, et al.
Veröffentlicht: (2024)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
von: Yue, Xiang, et al.
Veröffentlicht: (2023)
von: Yue, Xiang, et al.
Veröffentlicht: (2023)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios
von: Huang, Zhongzhen, et al.
Veröffentlicht: (2025)
von: Huang, Zhongzhen, et al.
Veröffentlicht: (2025)
Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers
von: Chen, Xin, et al.
Veröffentlicht: (2026)
von: Chen, Xin, et al.
Veröffentlicht: (2026)
Reason to Contrast: A Cascaded Multimodal Retrieval Framework
von: Cui, Xuanming, et al.
Veröffentlicht: (2025)
von: Cui, Xuanming, et al.
Veröffentlicht: (2025)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
von: Liu, Chengzhi, et al.
Veröffentlicht: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
von: Jiang, Ruixiang, et al.
Veröffentlicht: (2025)
von: Jiang, Ruixiang, et al.
Veröffentlicht: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
von: Long, Yitao, et al.
Veröffentlicht: (2025)
von: Long, Yitao, et al.
Veröffentlicht: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
von: Jin, Congyun, et al.
Veröffentlicht: (2024)
von: Jin, Congyun, et al.
Veröffentlicht: (2024)
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
von: Yan, Yibo, et al.
Veröffentlicht: (2025)
von: Yan, Yibo, et al.
Veröffentlicht: (2025)
Debating for Better Reasoning: An Unsupervised Multimodal Approach
von: Adhikari, Ashutosh, et al.
Veröffentlicht: (2025)
von: Adhikari, Ashutosh, et al.
Veröffentlicht: (2025)
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
von: Hu, Wenbo, et al.
Veröffentlicht: (2026)
von: Hu, Wenbo, et al.
Veröffentlicht: (2026)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
von: Liu, Zeyu, et al.
Veröffentlicht: (2025)
von: Liu, Zeyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs
von: Yan, Qianqi, et al.
Veröffentlicht: (2025) -
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
von: Fan, Yue, et al.
Veröffentlicht: (2024) -
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
von: Yan, Qianqi, et al.
Veröffentlicht: (2026) -
SUPERChem: A Multimodal Reasoning Benchmark in Chemistry
von: Zhao, Zehua, et al.
Veröffentlicht: (2025) -
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)