STRMs: Spatial Temporal Reasoning Models for Vision-Based Localization Rivaling GPS Precision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lui, Hin Wai, Krichmar, Jeffrey L. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Vision from Models Rivals Learning Vision from Data
par: Tian, Yonglong, et autres
Publié: (2023)
par: Tian, Yonglong, et autres
Publié: (2023)
SpatialBot: Precise Spatial Understanding with Vision Language Models
par: Cai, Wenxiao, et autres
Publié: (2024)
par: Cai, Wenxiao, et autres
Publié: (2024)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
par: Wu, Xiyang, et autres
Publié: (2025)
par: Wu, Xiyang, et autres
Publié: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
par: Huang, Bowen, et autres
Publié: (2024)
par: Huang, Bowen, et autres
Publié: (2024)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
par: Cui, Cheng, et autres
Publié: (2026)
par: Cui, Cheng, et autres
Publié: (2026)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
par: Souza, Rafael, et autres
Publié: (2024)
par: Souza, Rafael, et autres
Publié: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
Vision-Language Memory for Spatial Reasoning
par: Liu, Zuntao, et autres
Publié: (2025)
par: Liu, Zuntao, et autres
Publié: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
par: Huang, Xinmiao, et autres
Publié: (2025)
par: Huang, Xinmiao, et autres
Publié: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
par: Liang, Yiming, et autres
Publié: (2026)
par: Liang, Yiming, et autres
Publié: (2026)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
par: Li, Yun, et autres
Publié: (2025)
par: Li, Yun, et autres
Publié: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
par: Xie, Qinghongbing, et autres
Publié: (2025)
par: Xie, Qinghongbing, et autres
Publié: (2025)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
par: Chen, Zeyuan, et autres
Publié: (2025)
par: Chen, Zeyuan, et autres
Publié: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
par: Stogiannidis, Ilias, et autres
Publié: (2025)
par: Stogiannidis, Ilias, et autres
Publié: (2025)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
par: Xu, Huilin, et autres
Publié: (2025)
par: Xu, Huilin, et autres
Publié: (2025)
Precise GPS-Denied UAV Self-Positioning via Context-Enhanced Cross-View Geo-Localization
par: Xu, Yuanze, et autres
Publié: (2025)
par: Xu, Yuanze, et autres
Publié: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
par: Zhang, Jiahuan, et autres
Publié: (2025)
par: Zhang, Jiahuan, et autres
Publié: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
par: Gholami, Mohsen, et autres
Publié: (2025)
par: Gholami, Mohsen, et autres
Publié: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
par: Cui, Kelly, et autres
Publié: (2026)
par: Cui, Kelly, et autres
Publié: (2026)
STUPD: A Synthetic Dataset for Spatial and Temporal Relation Reasoning
par: Agrawal, Palaash, et autres
Publié: (2023)
par: Agrawal, Palaash, et autres
Publié: (2023)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
par: Xu, Ming, et autres
Publié: (2024)
par: Xu, Ming, et autres
Publié: (2024)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
par: Li, Jiaqi, et autres
Publié: (2026)
par: Li, Jiaqi, et autres
Publié: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
par: Ranjan, Mukul, et autres
Publié: (2026)
par: Ranjan, Mukul, et autres
Publié: (2026)
Altitude-Adaptive Vision-Only Geo-Localization for UAVs in GPS-Denied Environments
par: Shao, Xingyu, et autres
Publié: (2026)
par: Shao, Xingyu, et autres
Publié: (2026)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
par: Ko, Dohwan, et autres
Publié: (2025)
par: Ko, Dohwan, et autres
Publié: (2025)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
par: Feng, Zhiyuan, et autres
Publié: (2025)
par: Feng, Zhiyuan, et autres
Publié: (2025)
Temporal-Guided Visual Foundation Models for Event-Based Vision
par: Xia, Ruihao, et autres
Publié: (2025)
par: Xia, Ruihao, et autres
Publié: (2025)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
par: Ma, Chenyang, et autres
Publié: (2024)
par: Ma, Chenyang, et autres
Publié: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
par: Liu, Benlin, et autres
Publié: (2024)
par: Liu, Benlin, et autres
Publié: (2024)
Progressive Cross-Stream Cooperation in Spatial and Temporal Domain for Action Localization
par: Su, Rui, et autres
Publié: (2019)
par: Su, Rui, et autres
Publié: (2019)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
par: Lee, Youngwan, et autres
Publié: (2026)
par: Lee, Youngwan, et autres
Publié: (2026)
Documents similaires
-
Learning Vision from Models Rivals Learning Vision from Data
par: Tian, Yonglong, et autres
Publié: (2023) -
SpatialBot: Precise Spatial Understanding with Vision Language Models
par: Cai, Wenxiao, et autres
Publié: (2024) -
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
par: Wu, Xiyang, et autres
Publié: (2025) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024) -
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
par: Huang, Bowen, et autres
Publié: (2024)