Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Guo, Longteng, Wang, Yifan, Huo, Pengkang, Chen, Tailai, Wu, Yuze, Liu, Jing, Zhu, Xinxin
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866913161178775552
author Guo, Longteng
Wang, Yifan
Huo, Pengkang
Chen, Tailai
Wu, Yuze
Liu, Jing
Zhu, Xinxin
author_facet Guo, Longteng
Wang, Yifan
Huo, Pengkang
Chen, Tailai
Wu, Yuze
Liu, Jing
Zhu, Xinxin
contents Recent multimodal large language models (MLLMs) achieve strong performance on visual reasoning benchmarks, yet it remains unclear to what extent such performance reflects reasoning directly grounded in visual evidence. We introduce VisReason, a benchmark for vision-centric reasoning in everyday scenarios where perception and inference are tightly coupled. VisReason contains 1,505 questions across 10 categories spanning perceptual, structural, and conceptual reasoning. Our evaluation shows that VisReason poses a qualitatively different challenge from existing benchmarks, exposing substantial gaps between humans and current MLLMs and revealing limited benefits from test-time reasoning strategies. VisReason offers a focused diagnostic for evaluating vision-centric reasoning beyond language.
format Preprint
id arxiv_https___arxiv_org_abs_2605_25364
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
Guo, Longteng
Wang, Yifan
Huo, Pengkang
Chen, Tailai
Wu, Yuze
Liu, Jing
Zhu, Xinxin
Computer Vision and Pattern Recognition
Recent multimodal large language models (MLLMs) achieve strong performance on visual reasoning benchmarks, yet it remains unclear to what extent such performance reflects reasoning directly grounded in visual evidence. We introduce VisReason, a benchmark for vision-centric reasoning in everyday scenarios where perception and inference are tightly coupled. VisReason contains 1,505 questions across 10 categories spanning perceptual, structural, and conceptual reasoning. Our evaluation shows that VisReason poses a qualitatively different challenge from existing benchmarks, exposing substantial gaps between humans and current MLLMs and revealing limited benefits from test-time reasoning strategies. VisReason offers a focused diagnostic for evaluating vision-centric reasoning beyond language.
title Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2605.25364