SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, An-Chieh, Yin, Hongxu, Fu, Yang, Guo, Qiushan, Yang, Ruihan, Kautz, Jan, Wang, Xiaolong, Liu, Sifei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
von: Guo, Qiushan, et al.
Veröffentlicht: (2024)
COLMAP-Free 3D Gaussian Splatting
von: Fu, Yang, et al.
Veröffentlicht: (2023)
von: Fu, Yang, et al.
Veröffentlicht: (2023)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
von: Liu, Jiaqi, et al.
Veröffentlicht: (2025)
von: Liu, Jiaqi, et al.
Veröffentlicht: (2025)
SmolRGPT: Efficient Spatial Reasoning for Warehouse Environments with 600M Parameters
von: Traore, Abdarahmane, et al.
Veröffentlicht: (2025)
von: Traore, Abdarahmane, et al.
Veröffentlicht: (2025)
Parallel Sequence Modeling via Generalized Spatial Propagation Network
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
von: Yang, Chiao-An, et al.
Veröffentlicht: (2025)
von: Yang, Chiao-An, et al.
Veröffentlicht: (2025)
Vision-Language Memory for Spatial Reasoning
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
von: Liu, Zuntao, et al.
Veröffentlicht: (2025)
Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model
von: Jiao, Siwen, et al.
Veröffentlicht: (2026)
von: Jiao, Siwen, et al.
Veröffentlicht: (2026)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
von: Zhen, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhen, Haoyu, et al.
Veröffentlicht: (2026)
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
von: Heo, Miran, et al.
Veröffentlicht: (2025)
von: Heo, Miran, et al.
Veröffentlicht: (2025)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
von: Xia, Hongchi, et al.
Veröffentlicht: (2024)
von: Xia, Hongchi, et al.
Veröffentlicht: (2024)
Scaling Vision Pre-Training to 4K Resolution
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
von: Deng, Nianchen, et al.
Veröffentlicht: (2025)
von: Deng, Nianchen, et al.
Veröffentlicht: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
von: Huang, Xinmiao, et al.
Veröffentlicht: (2025)
von: Huang, Xinmiao, et al.
Veröffentlicht: (2025)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
von: Wu, Xiyang, et al.
Veröffentlicht: (2025)
von: Wu, Xiyang, et al.
Veröffentlicht: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
von: Wang, Feng, et al.
Veröffentlicht: (2026)
von: Wang, Feng, et al.
Veröffentlicht: (2026)
SpatialBot: Precise Spatial Understanding with Vision Language Models
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
von: Feng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Feng, Zhiyuan, et al.
Veröffentlicht: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
von: Guo, Xianda, et al.
Veröffentlicht: (2024)
von: Guo, Xianda, et al.
Veröffentlicht: (2024)
M3: 3D-Spatial MultiModal Memory
von: Zou, Xueyan, et al.
Veröffentlicht: (2025)
von: Zou, Xueyan, et al.
Veröffentlicht: (2025)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
von: Ma, Chenyang, et al.
Veröffentlicht: (2024)
von: Ma, Chenyang, et al.
Veröffentlicht: (2024)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
von: Man, Yunze, et al.
Veröffentlicht: (2025)
von: Man, Yunze, et al.
Veröffentlicht: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
von: Zhang, Jiahuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jiahuan, et al.
Veröffentlicht: (2025)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
von: Guo, Jiajie, et al.
Veröffentlicht: (2025)
von: Guo, Jiajie, et al.
Veröffentlicht: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
von: Rajabi, Navid, et al.
Veröffentlicht: (2023)
von: Rajabi, Navid, et al.
Veröffentlicht: (2023)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
von: Ma, Chuang, et al.
Veröffentlicht: (2026)
von: Ma, Chuang, et al.
Veröffentlicht: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
von: Song, Python, et al.
Veröffentlicht: (2025)
von: Song, Python, et al.
Veröffentlicht: (2025)
NVILA: Efficient Frontier Visual Language Models
von: Liu, Zhijian, et al.
Veröffentlicht: (2024)
von: Liu, Zhijian, et al.
Veröffentlicht: (2024)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
von: Tian, Kexin, et al.
Veröffentlicht: (2025)
von: Tian, Kexin, et al.
Veröffentlicht: (2025)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
von: Zhou, Enshen, et al.
Veröffentlicht: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
von: Liang, Huizhi, et al.
Veröffentlicht: (2026)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
von: Wang, Yuxin, et al.
Veröffentlicht: (2025)
The Spatial Blindspot of Vision-Language Models
von: Alam, Nahid, et al.
Veröffentlicht: (2026)
von: Alam, Nahid, et al.
Veröffentlicht: (2026)
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
von: Zhang, Mengqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026) -
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024) -
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025) -
RegionGPT: Towards Region Understanding Vision Language Model
von: Guo, Qiushan, et al.
Veröffentlicht: (2024) -
COLMAP-Free 3D Gaussian Splatting
von: Fu, Yang, et al.
Veröffentlicht: (2023)