Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Anand, Dhruv, Shareghi, Ehsan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
par: Gao, Huan-ang, et autres
Publié: (2025)
par: Gao, Huan-ang, et autres
Publié: (2025)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
par: Mayer, Julius, et autres
Publié: (2025)
par: Mayer, Julius, et autres
Publié: (2025)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
par: Fang, I-Sheng, et autres
Publié: (2025)
par: Fang, I-Sheng, et autres
Publié: (2025)
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
par: AI, Inclusion, et autres
Publié: (2025)
par: AI, Inclusion, et autres
Publié: (2025)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
par: Gao, Xiangbo, et autres
Publié: (2026)
par: Gao, Xiangbo, et autres
Publié: (2026)
AdaCodec: A Predictive Visual Code for Video MLLMs
par: Hou, Haowen, et autres
Publié: (2026)
par: Hou, Haowen, et autres
Publié: (2026)
VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning
par: Yilmaz, Nilay, et autres
Publié: (2025)
par: Yilmaz, Nilay, et autres
Publié: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
par: Wang, Andong, et autres
Publié: (2024)
par: Wang, Andong, et autres
Publié: (2024)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
MindCube: Spatial Mental Modeling from Limited Views
par: Wang, Qineng, et autres
Publié: (2025)
par: Wang, Qineng, et autres
Publié: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs
par: Wang, Siting, et autres
Publié: (2025)
par: Wang, Siting, et autres
Publié: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
par: Chen, Kesheng, et autres
Publié: (2026)
par: Chen, Kesheng, et autres
Publié: (2026)
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2026)
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2026)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
par: Ouyang, Kun, et autres
Publié: (2024)
par: Ouyang, Kun, et autres
Publié: (2024)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
par: Dai, Yang, et autres
Publié: (2026)
par: Dai, Yang, et autres
Publié: (2026)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
par: Satar, Burak, et autres
Publié: (2025)
par: Satar, Burak, et autres
Publié: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
par: Ji, Haonian, et autres
Publié: (2025)
par: Ji, Haonian, et autres
Publié: (2025)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
par: Li, Dingming, et autres
Publié: (2025)
par: Li, Dingming, et autres
Publié: (2025)
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023)
par: Liu, Yanqing, et autres
Publié: (2023)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
par: Shang, Fangxin, et autres
Publié: (2025)
par: Shang, Fangxin, et autres
Publié: (2025)
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
par: Zhang, Chenkai, et autres
Publié: (2025)
par: Zhang, Chenkai, et autres
Publié: (2025)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
par: Wu, Xueqing, et autres
Publié: (2024)
par: Wu, Xueqing, et autres
Publié: (2024)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
par: Zou, Chengke, et autres
Publié: (2024)
par: Zou, Chengke, et autres
Publié: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations
par: Xie, Yupeng, et autres
Publié: (2025)
par: Xie, Yupeng, et autres
Publié: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
par: Xu, Haotian, et autres
Publié: (2026)
par: Xu, Haotian, et autres
Publié: (2026)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Documents similaires
-
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
par: Gao, Huan-ang, et autres
Publié: (2025) -
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024) -
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
par: Mayer, Julius, et autres
Publié: (2025) -
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026) -
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
par: Fang, I-Sheng, et autres
Publié: (2025)