VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
Fuente:
arXiv
Saved in:
| Main Authors: | Qiang, Chenhui, Wei, Zhaoyang, Han, Xumeng, Wang, Zipeng, Li, Siyao, Lan, Xiangyuan, Jiao, Jianbin, Han, Zhenjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
by: Wei, Zhaoyang, et al.
Published: (2025)
by: Wei, Zhaoyang, et al.
Published: (2025)
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
by: Li, Jiashu, et al.
Published: (2026)
by: Li, Jiashu, et al.
Published: (2026)
P2Seg: Pointly-supervised Segmentation via Mutual Distillation
by: Wang, Zipeng, et al.
Published: (2024)
by: Wang, Zipeng, et al.
Published: (2024)
SAPNet++: Evolving Point-Prompted Instance Segmentation with Semantic and Spatial Awareness
by: Wei, Zhaoyang, et al.
Published: (2026)
by: Wei, Zhaoyang, et al.
Published: (2026)
ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts
by: Han, Xumeng, et al.
Published: (2024)
by: Han, Xumeng, et al.
Published: (2024)
GaGA: Towards Interactive Global Geolocation Assistant
by: Dou, Zhiyang, et al.
Published: (2024)
by: Dou, Zhiyang, et al.
Published: (2024)
Semantic-aware SAM for Point-Prompted Instance Segmentation
by: Wei, Zhaoyang, et al.
Published: (2023)
by: Wei, Zhaoyang, et al.
Published: (2023)
P2Object: Single Point Supervised Object Detection and Instance Segmentation
by: Chen, Pengfei, et al.
Published: (2025)
by: Chen, Pengfei, et al.
Published: (2025)
P2RBox: Point Prompt Oriented Object Detection with SAM
by: Cao, Guangming, et al.
Published: (2023)
by: Cao, Guangming, et al.
Published: (2023)
CPR++: Object Localization via Single Coarse Point Supervision
by: Yu, Xuehui, et al.
Published: (2024)
by: Yu, Xuehui, et al.
Published: (2024)
Rethinking Sampling Strategies for Unsupervised Person Re-identification
by: Han, Xumeng, et al.
Published: (2021)
by: Han, Xumeng, et al.
Published: (2021)
ClickTrack: Towards Real-time Interactive Single Object Tracking
by: Wang, Kuiran, et al.
Published: (2024)
by: Wang, Kuiran, et al.
Published: (2024)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
by: Bao, Zhijie, et al.
Published: (2026)
by: Bao, Zhijie, et al.
Published: (2026)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
by: Qiu, Yansheng, et al.
Published: (2025)
by: Qiu, Yansheng, et al.
Published: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
by: Fang, I-Sheng, et al.
Published: (2025)
by: Fang, I-Sheng, et al.
Published: (2025)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
by: Zhang, Shan, et al.
Published: (2025)
by: Zhang, Shan, et al.
Published: (2025)
Boosting Segment Anything Model Towards Open-Vocabulary Learning
by: Han, Xumeng, et al.
Published: (2023)
by: Han, Xumeng, et al.
Published: (2023)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
by: Chen, Feng, et al.
Published: (2025)
by: Chen, Feng, et al.
Published: (2025)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
by: Zhu, Jie, et al.
Published: (2026)
by: Zhu, Jie, et al.
Published: (2026)
Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench
by: Ye, Zanting, et al.
Published: (2026)
by: Ye, Zanting, et al.
Published: (2026)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
by: Anand, Dhruv, et al.
Published: (2025)
by: Anand, Dhruv, et al.
Published: (2025)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
by: Lee, Naeun, et al.
Published: (2026)
by: Lee, Naeun, et al.
Published: (2026)
HueManity: Probing Fine-Grained Visual Perception in MLLMs
by: Grover, Rynaa, et al.
Published: (2025)
by: Grover, Rynaa, et al.
Published: (2025)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
by: Dai, Yang, et al.
Published: (2026)
by: Dai, Yang, et al.
Published: (2026)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
by: Shan, Haozhe, et al.
Published: (2026)
by: Shan, Haozhe, et al.
Published: (2026)
VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
by: Liu, Yuanxin, et al.
Published: (2025)
by: Liu, Yuanxin, et al.
Published: (2025)
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
by: Zhang, Tao, et al.
Published: (2025)
by: Zhang, Tao, et al.
Published: (2025)
FunBench: Benchmarking Fundus Reading Skills of MLLMs
by: Wei, Qijie, et al.
Published: (2025)
by: Wei, Qijie, et al.
Published: (2025)
Reasoning over Video: Evaluating How MLLMs Extract, Integrate, and Reconstruct Spatiotemporal Evidence
by: Bang, Seunghwan, et al.
Published: (2026)
by: Bang, Seunghwan, et al.
Published: (2026)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
by: Xiao, Kelaiti, et al.
Published: (2025)
by: Xiao, Kelaiti, et al.
Published: (2025)
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
by: Pan, Hongkun, et al.
Published: (2026)
by: Pan, Hongkun, et al.
Published: (2026)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
by: Zheng, Yushuo, et al.
Published: (2026)
by: Zheng, Yushuo, et al.
Published: (2026)
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
by: Huang, Yanxiang, et al.
Published: (2026)
by: Huang, Yanxiang, et al.
Published: (2026)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
by: Xu, Yunqiu, et al.
Published: (2024)
by: Xu, Yunqiu, et al.
Published: (2024)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
by: Zhao, Zhixian, et al.
Published: (2026)
by: Zhao, Zhixian, et al.
Published: (2026)
S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework
by: Li, Yingshu, et al.
Published: (2025)
by: Li, Yingshu, et al.
Published: (2025)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
by: Tang, Yuqi, et al.
Published: (2026)
by: Tang, Yuqi, et al.
Published: (2026)
Training-Free Reasoning and Reflection in MLLMs
by: Wei, Hongchen, et al.
Published: (2025)
by: Wei, Hongchen, et al.
Published: (2025)
Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs
by: Sun, Ningyu, et al.
Published: (2026)
by: Sun, Ningyu, et al.
Published: (2026)
Similar Items
-
AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions
by: Wei, Zhaoyang, et al.
Published: (2025) -
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
by: Li, Jiashu, et al.
Published: (2026) -
P2Seg: Pointly-supervised Segmentation via Mutual Distillation
by: Wang, Zipeng, et al.
Published: (2024) -
SAPNet++: Evolving Point-Prompted Instance Segmentation with Semantic and Spatial Awareness
by: Wei, Zhaoyang, et al.
Published: (2026) -
ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts
by: Han, Xumeng, et al.
Published: (2024)