STRMs: Spatial Temporal Reasoning Models for Vision-Based Localization Rivaling GPS Precision
Fuente:
arXiv
Guardado en:
| Autores principales: | Lui, Hin Wai, Krichmar, Jeffrey L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Vision from Models Rivals Learning Vision from Data
por: Tian, Yonglong, et al.
Publicado: (2023)
por: Tian, Yonglong, et al.
Publicado: (2023)
SpatialBot: Precise Spatial Understanding with Vision Language Models
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025)
por: Wu, Xiyang, et al.
Publicado: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
por: Huang, Bowen, et al.
Publicado: (2024)
por: Huang, Bowen, et al.
Publicado: (2024)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
por: Cui, Cheng, et al.
Publicado: (2026)
por: Cui, Cheng, et al.
Publicado: (2026)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
por: Souza, Rafael, et al.
Publicado: (2024)
por: Souza, Rafael, et al.
Publicado: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
Vision-Language Memory for Spatial Reasoning
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
por: Wang, Fengshun, et al.
Publicado: (2026)
por: Wang, Fengshun, et al.
Publicado: (2026)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
por: Liang, Yiming, et al.
Publicado: (2026)
por: Liang, Yiming, et al.
Publicado: (2026)
STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
por: Li, Yun, et al.
Publicado: (2025)
por: Li, Yun, et al.
Publicado: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
por: Xie, Qinghongbing, et al.
Publicado: (2025)
por: Xie, Qinghongbing, et al.
Publicado: (2025)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
por: Chen, Zeyuan, et al.
Publicado: (2025)
por: Chen, Zeyuan, et al.
Publicado: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
por: Xu, Huilin, et al.
Publicado: (2025)
por: Xu, Huilin, et al.
Publicado: (2025)
Precise GPS-Denied UAV Self-Positioning via Context-Enhanced Cross-View Geo-Localization
por: Xu, Yuanze, et al.
Publicado: (2025)
por: Xu, Yuanze, et al.
Publicado: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
por: Zhang, Jiahuan, et al.
Publicado: (2025)
por: Zhang, Jiahuan, et al.
Publicado: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
por: Gholami, Mohsen, et al.
Publicado: (2025)
por: Gholami, Mohsen, et al.
Publicado: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
por: Zhou, Shengchao, et al.
Publicado: (2025)
por: Zhou, Shengchao, et al.
Publicado: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
por: Guo, Xianda, et al.
Publicado: (2024)
por: Guo, Xianda, et al.
Publicado: (2024)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026)
por: Cui, Kelly, et al.
Publicado: (2026)
STUPD: A Synthetic Dataset for Spatial and Temporal Relation Reasoning
por: Agrawal, Palaash, et al.
Publicado: (2023)
por: Agrawal, Palaash, et al.
Publicado: (2023)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization
por: Li, Jiaqi, et al.
Publicado: (2026)
por: Li, Jiaqi, et al.
Publicado: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
por: Ranjan, Mukul, et al.
Publicado: (2026)
por: Ranjan, Mukul, et al.
Publicado: (2026)
Altitude-Adaptive Vision-Only Geo-Localization for UAVs in GPS-Denied Environments
por: Shao, Xingyu, et al.
Publicado: (2026)
por: Shao, Xingyu, et al.
Publicado: (2026)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2025)
por: Ko, Dohwan, et al.
Publicado: (2025)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
por: Yuan, Tianyuan, et al.
Publicado: (2025)
por: Yuan, Tianyuan, et al.
Publicado: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
Temporal-Guided Visual Foundation Models for Event-Based Vision
por: Xia, Ruihao, et al.
Publicado: (2025)
por: Xia, Ruihao, et al.
Publicado: (2025)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
por: Ma, Chenyang, et al.
Publicado: (2024)
por: Ma, Chenyang, et al.
Publicado: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
por: Liu, Benlin, et al.
Publicado: (2024)
por: Liu, Benlin, et al.
Publicado: (2024)
Progressive Cross-Stream Cooperation in Spatial and Temporal Domain for Action Localization
por: Su, Rui, et al.
Publicado: (2019)
por: Su, Rui, et al.
Publicado: (2019)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
por: Lee, Youngwan, et al.
Publicado: (2026)
por: Lee, Youngwan, et al.
Publicado: (2026)
Ejemplares similares
-
Learning Vision from Models Rivals Learning Vision from Data
por: Tian, Yonglong, et al.
Publicado: (2023) -
SpatialBot: Precise Spatial Understanding with Vision Language Models
por: Cai, Wenxiao, et al.
Publicado: (2024) -
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024) -
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
por: Huang, Bowen, et al.
Publicado: (2024)