An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Shiri, Fatemeh, Guo, Xiao-Yu, Far, Mona Golestan, Yu, Xin, Haffari, Gholamreza, Li, Yuan-Fang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoV: Chain-of-View Prompting for Spatial Reasoning
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
di: Xu, Zelin, et al.
Pubblicazione: (2026)
di: Xu, Zelin, et al.
Pubblicazione: (2026)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
di: Guo, Yifu, et al.
Pubblicazione: (2025)
di: Guo, Yifu, et al.
Pubblicazione: (2025)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science
di: Zhang, Jie, et al.
Pubblicazione: (2026)
di: Zhang, Jie, et al.
Pubblicazione: (2026)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
di: Liu, Daixian, et al.
Pubblicazione: (2026)
di: Liu, Daixian, et al.
Pubblicazione: (2026)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
Explain Before You Answer: A Survey on Compositional Visual Reasoning
di: Ke, Fucai, et al.
Pubblicazione: (2025)
di: Ke, Fucai, et al.
Pubblicazione: (2025)
Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning
di: Fang, Jiading
Pubblicazione: (2025)
di: Fang, Jiading
Pubblicazione: (2025)
FEALLM: Advancing Facial Emotion Analysis in Multimodal Large Language Models with Emotional Synergy and Reasoning
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
di: Hu, Zhuozhao, et al.
Pubblicazione: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video Generation
di: Feng, Tao, et al.
Pubblicazione: (2025)
di: Feng, Tao, et al.
Pubblicazione: (2025)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
di: Xiao, Tong, et al.
Pubblicazione: (2025)
di: Xiao, Tong, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?
di: Xiang, Kun, et al.
Pubblicazione: (2025)
di: Xiang, Kun, et al.
Pubblicazione: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model
di: Guo, Yu, et al.
Pubblicazione: (2026)
di: Guo, Yu, et al.
Pubblicazione: (2026)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains
di: Guo, Garvin, et al.
Pubblicazione: (2026)
di: Guo, Garvin, et al.
Pubblicazione: (2026)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
di: Liu, Tianhui, et al.
Pubblicazione: (2026)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs
di: Zhu, Rui, et al.
Pubblicazione: (2026)
di: Zhu, Rui, et al.
Pubblicazione: (2026)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation
di: Liu, Akide, et al.
Pubblicazione: (2026)
di: Liu, Akide, et al.
Pubblicazione: (2026)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
di: Jian, Ai, et al.
Pubblicazione: (2025)
di: Jian, Ai, et al.
Pubblicazione: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
di: Ou, Siqu, et al.
Pubblicazione: (2025)
di: Ou, Siqu, et al.
Pubblicazione: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning
di: Ye, Guanting, et al.
Pubblicazione: (2026)
di: Ye, Guanting, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CoV: Chain-of-View Prompting for Spatial Reasoning
di: Zhao, Haoyu, et al.
Pubblicazione: (2026) -
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026) -
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
di: Xu, Zelin, et al.
Pubblicazione: (2026) -
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
di: Kancheti, Sai Srinivas, et al.
Pubblicazione: (2026) -
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
di: Guo, Yifu, et al.
Pubblicazione: (2025)