SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Jiajie, Zhu, Qingpeng, Zeng, Jin, Wu, Xiaolong, He, Changyong, Wang, Weida |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Consistent Time-of-Flight Depth Denoising via Graph-Informed Geometric Attention
par: Wang, Weida, et autres
Publié: (2025)
par: Wang, Weida, et autres
Publié: (2025)
Towards Robust Time-of-Flight Depth Denoising with Confidence-Aware Diffusion Model
par: He, Changyong, et autres
Publié: (2025)
par: He, Changyong, et autres
Publié: (2025)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
par: Zhang, Jian, et autres
Publié: (2026)
par: Zhang, Jian, et autres
Publié: (2026)
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
par: Li, Haoyuan, et autres
Publié: (2026)
par: Li, Haoyuan, et autres
Publié: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
par: Liu, Benlin, et autres
Publié: (2024)
par: Liu, Benlin, et autres
Publié: (2024)
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
par: Li, Zongzhao, et autres
Publié: (2025)
par: Li, Zongzhao, et autres
Publié: (2025)
Learning Proposes, Geometry Disposes: A Modular Framework for Efficient Spatial Reasoning
par: Zhu, Haichao, et autres
Publié: (2026)
par: Zhu, Haichao, et autres
Publié: (2026)
Unified Multimodal Coherent Field: Synchronous Semantic-Spatial-Vision Fusion for Brain Tumor Segmentation
par: Zhang, Mingda, et autres
Publié: (2025)
par: Zhang, Mingda, et autres
Publié: (2025)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
par: Zeng, Shuang, et autres
Publié: (2025)
par: Zeng, Shuang, et autres
Publié: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
Make Geometry Matter for Spatial Reasoning
par: Zhang, Shihua, et autres
Publié: (2026)
par: Zhang, Shihua, et autres
Publié: (2026)
AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
Structural Pruning via Spatial-aware Information Redundancy for Semantic Segmentation
par: Wu, Dongyue, et autres
Publié: (2024)
par: Wu, Dongyue, et autres
Publié: (2024)
Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
par: Kancheti, Sai Srinivas, et autres
Publié: (2026)
SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs
par: Li, Jiawei, et autres
Publié: (2026)
par: Li, Jiawei, et autres
Publié: (2026)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
par: Ning, Zhenhua, et autres
Publié: (2025)
par: Ning, Zhenhua, et autres
Publié: (2025)
3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
par: Ge, Xuri, et autres
Publié: (2024)
par: Ge, Xuri, et autres
Publié: (2024)
MSSFC-Net:Enhancing Building Interpretation with Multi-Scale Spatial-Spectral Feature Collaboration
par: Huo, Dehua, et autres
Publié: (2025)
par: Huo, Dehua, et autres
Publié: (2025)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
par: Xu, Beining, et autres
Publié: (2025)
par: Xu, Beining, et autres
Publié: (2025)
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning
par: Jeon, Byungwoo, et autres
Publié: (2026)
par: Jeon, Byungwoo, et autres
Publié: (2026)
SIESEF-FusionNet: Spatial Inter-correlation Enhancement and Spatially-Embedded Feature Fusion Network for LiDAR Point Cloud Semantic Segmentation
par: Chen, Jiale, et autres
Publié: (2024)
par: Chen, Jiale, et autres
Publié: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
par: Hua, Jiacheng, et autres
Publié: (2026)
par: Hua, Jiacheng, et autres
Publié: (2026)
Boosting Reasoning in Large Multimodal Models via Activation Replay
par: Xing, Yun, et autres
Publié: (2025)
par: Xing, Yun, et autres
Publié: (2025)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
par: Rajabi, Navid, et autres
Publié: (2024)
par: Rajabi, Navid, et autres
Publié: (2024)
SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion
par: Zheng, Naichuan, et autres
Publié: (2025)
par: Zheng, Naichuan, et autres
Publié: (2025)
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
par: Li, Yian, et autres
Publié: (2026)
par: Li, Yian, et autres
Publié: (2026)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
par: Zheng, Xu, et autres
Publié: (2025)
par: Zheng, Xu, et autres
Publié: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations
par: Yuan, Jiangye, et autres
Publié: (2026)
par: Yuan, Jiangye, et autres
Publié: (2026)
Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
Perception-Aware Multimodal Spatial Reasoning from Monocular Images
par: Cheng, Yanchun, et autres
Publié: (2026)
par: Cheng, Yanchun, et autres
Publié: (2026)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
par: Dongfang, Zihao, et autres
Publié: (2025)
par: Dongfang, Zihao, et autres
Publié: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
par: Shiri, Fatemeh, et autres
Publié: (2024)
par: Shiri, Fatemeh, et autres
Publié: (2024)
Geometry without Position? When Positional Embeddings Help and Hurt Spatial Reasoning
par: Shi, Jian, et autres
Publié: (2026)
par: Shi, Jian, et autres
Publié: (2026)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
par: Jin, Zhao, et autres
Publié: (2025)
par: Jin, Zhao, et autres
Publié: (2025)
UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations
par: Mühlematter, Dominik J., et autres
Publié: (2025)
par: Mühlematter, Dominik J., et autres
Publié: (2025)
Documents similaires
-
Consistent Time-of-Flight Depth Denoising via Graph-Informed Geometric Attention
par: Wang, Weida, et autres
Publié: (2025) -
Towards Robust Time-of-Flight Depth Denoising with Confidence-Aware Diffusion Model
par: He, Changyong, et autres
Publié: (2025) -
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
par: Zhang, Jian, et autres
Publié: (2026) -
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
par: Li, Haoyuan, et autres
Publié: (2026) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)