MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yulun, Chai, Yekun, Brbić, Maria, Moor, Michael |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
di: Anand, Dhruv, et al.
Pubblicazione: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
di: Mayer, Julius, et al.
Pubblicazione: (2025)
di: Mayer, Julius, et al.
Pubblicazione: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
di: Yue, Xiang, et al.
Pubblicazione: (2023)
di: Yue, Xiang, et al.
Pubblicazione: (2023)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
di: Liu, Daixian, et al.
Pubblicazione: (2026)
di: Liu, Daixian, et al.
Pubblicazione: (2026)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping
di: Wu, Yu, et al.
Pubblicazione: (2026)
di: Wu, Yu, et al.
Pubblicazione: (2026)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
di: Xu, Zelin, et al.
Pubblicazione: (2026)
di: Xu, Zelin, et al.
Pubblicazione: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
di: Chen, Shuang, et al.
Pubblicazione: (2025)
di: Chen, Shuang, et al.
Pubblicazione: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
di: Batra, Hunar, et al.
Pubblicazione: (2025)
di: Batra, Hunar, et al.
Pubblicazione: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
di: Cai, Zhenyang, et al.
Pubblicazione: (2025)
di: Cai, Zhenyang, et al.
Pubblicazione: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
di: Satar, Burak, et al.
Pubblicazione: (2025)
di: Satar, Burak, et al.
Pubblicazione: (2025)
Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
di: Zhu, Zhihao, et al.
Pubblicazione: (2026)
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
di: Sun, Kai, et al.
Pubblicazione: (2025)
di: Sun, Kai, et al.
Pubblicazione: (2025)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
di: Wu, Bo, et al.
Pubblicazione: (2024)
di: Wu, Bo, et al.
Pubblicazione: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
Generative Universal Verifier as Multimodal Meta-Reasoner
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
di: Zhang, Xinchen, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
Multimodal Fact-Level Attribution for Verifiable Reasoning
di: Wan, David, et al.
Pubblicazione: (2026)
di: Wan, David, et al.
Pubblicazione: (2026)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025)
di: Li, Shilong, et al.
Pubblicazione: (2025)
NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification
di: Song, Ziyang, et al.
Pubblicazione: (2025)
di: Song, Ziyang, et al.
Pubblicazione: (2025)
Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
di: Chandu, Khyathi Raghavi, et al.
Pubblicazione: (2024)
di: Chandu, Khyathi Raghavi, et al.
Pubblicazione: (2024)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
di: Zhang, Ge, et al.
Pubblicazione: (2024)
di: Zhang, Ge, et al.
Pubblicazione: (2024)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
Benchmarking Multimodal Large Language Models for Face Recognition
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025) -
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
di: Anand, Dhruv, et al.
Pubblicazione: (2025) -
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025) -
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
di: Mayer, Julius, et al.
Pubblicazione: (2025) -
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)