Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Yihong, Qu, Ao, Wang, Zhaokai, Zhuang, Dingyi, Wu, Zhaofeng, Ma, Wei, Wang, Shenhao, Zheng, Yunhan, Zhao, Zhan, Zhao, Jinhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ITINERA: Integrating Spatial Optimization with Large Language Models for Open-domain Urban Itinerary Planning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Reimagining Urban Science: Scaling Causal Inference with Large Language Models
por: Xia, Yutong, et al.
Publicado: (2025)
por: Xia, Yutong, et al.
Publicado: (2025)
Mitigating Spatial Disparity in Urban Prediction Using Residual-Aware Spatiotemporal Graph Neural Networks: A Chicago Case Study
por: Zhuang, Dingyi, et al.
Publicado: (2025)
por: Zhuang, Dingyi, et al.
Publicado: (2025)
GETS: Ensemble Temperature Scaling for Calibration in Graph Neural Networks
por: Zhuang, Dingyi, et al.
Publicado: (2024)
por: Zhuang, Dingyi, et al.
Publicado: (2024)
Generative AI for Urban Planning: Synthesizing Satellite Imagery via Diffusion Models
por: Wang, Qingyi, et al.
Publicado: (2025)
por: Wang, Qingyi, et al.
Publicado: (2025)
Leveraging the Spatial Hierarchy: Coarse-to-fine Trajectory Generation via Cascaded Hybrid Diffusion
por: Guo, Baoshen, et al.
Publicado: (2025)
por: Guo, Baoshen, et al.
Publicado: (2025)
Virtual Nodes Improve Long-term Traffic Prediction
por: Cao, Xiaoyang, et al.
Publicado: (2025)
por: Cao, Xiaoyang, et al.
Publicado: (2025)
Advancing Transportation Mode Share Analysis with Built Environment: Deep Hybrid Models with Urban Road Network
por: Zhuang, Dingyi, et al.
Publicado: (2024)
por: Zhuang, Dingyi, et al.
Publicado: (2024)
Deep hybrid model with satellite imagery: how to combine demand modeling and computer vision for behavior analysis?
por: Wang, Qingyi, et al.
Publicado: (2023)
por: Wang, Qingyi, et al.
Publicado: (2023)
Uncertainty Quantification of Spatiotemporal Travel Demand with Probabilistic Graph Neural Networks
por: Wang, Qingyi, et al.
Publicado: (2023)
por: Wang, Qingyi, et al.
Publicado: (2023)
SAUC: Sparsity-Aware Uncertainty Calibration for Spatiotemporal Prediction with Graph Neural Networks
por: Zhuang, Dingyi, et al.
Publicado: (2024)
por: Zhuang, Dingyi, et al.
Publicado: (2024)
Generative AI for Urban Design: A Stepwise Approach Integrating Human Expertise with Multimodal Diffusion Models
por: He, Mingyi, et al.
Publicado: (2025)
por: He, Mingyi, et al.
Publicado: (2025)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
por: Chen, Boyuan, et al.
Publicado: (2024)
por: Chen, Boyuan, et al.
Publicado: (2024)
From Patchwork to Network: A Comprehensive Framework for Demand Analysis and Fleet Optimization of Urban Air Mobility
por: Jiang, Xuan, et al.
Publicado: (2025)
por: Jiang, Xuan, et al.
Publicado: (2025)
From Street Views to Urban Science: Discovering Road Safety Factors with Multimodal Large Language Models
por: Tang, Yihong, et al.
Publicado: (2025)
por: Tang, Yihong, et al.
Publicado: (2025)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
Envisioning global urban development with satellite imagery and generative AI
por: Sun, Kailai, et al.
Publicado: (2026)
por: Sun, Kailai, et al.
Publicado: (2026)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
por: Liu, Tianhui, et al.
Publicado: (2026)
por: Liu, Tianhui, et al.
Publicado: (2026)
Comparing hundreds of machine learning classifiers and discrete choice models in predicting travel behavior: an empirical benchmark
por: Wang, Shenhao, et al.
Publicado: (2021)
por: Wang, Shenhao, et al.
Publicado: (2021)
Fairness-Enhancing Vehicle Rebalancing in the Ride-hailing System
por: Guo, Xiaotong, et al.
Publicado: (2023)
por: Guo, Xiaotong, et al.
Publicado: (2023)
Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models
por: Zhao, Yunhan, et al.
Publicado: (2025)
por: Zhao, Yunhan, et al.
Publicado: (2025)
SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
por: Ma, Chenyang, et al.
Publicado: (2024)
por: Ma, Chenyang, et al.
Publicado: (2024)
Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models
por: Wang, Dongdong, et al.
Publicado: (2026)
por: Wang, Dongdong, et al.
Publicado: (2026)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
por: Zhang, Yunxiang, et al.
Publicado: (2025)
por: Zhang, Yunxiang, et al.
Publicado: (2025)
Vision-Language Memory for Spatial Reasoning
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
por: Zhao, Bowen, et al.
Publicado: (2024)
por: Zhao, Bowen, et al.
Publicado: (2024)
Uncertainty-Aware Probabilistic Graph Neural Networks for Road-Level Traffic Accident Prediction
por: Gao, Xiaowei, et al.
Publicado: (2023)
por: Gao, Xiaowei, et al.
Publicado: (2023)
Risk-Controllable Multi-View Diffusion for Driving Scenario Generation
por: Lin, Hongyi, et al.
Publicado: (2026)
por: Lin, Hongyi, et al.
Publicado: (2026)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
por: Zhan, Shaoxiong, et al.
Publicado: (2026)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
por: Ma, Chuang, et al.
Publicado: (2026)
por: Ma, Chuang, et al.
Publicado: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
por: Xu, Beining, et al.
Publicado: (2025)
por: Xu, Beining, et al.
Publicado: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
por: Zhao, Yanpeng, et al.
Publicado: (2026)
por: Zhao, Yanpeng, et al.
Publicado: (2026)
Ejemplares similares
-
ITINERA: Integrating Spatial Optimization with Large Language Models for Open-domain Urban Itinerary Planning
por: Tang, Yihong, et al.
Publicado: (2024) -
Reimagining Urban Science: Scaling Causal Inference with Large Language Models
por: Xia, Yutong, et al.
Publicado: (2025) -
Mitigating Spatial Disparity in Urban Prediction Using Residual-Aware Spatiotemporal Graph Neural Networks: A Chicago Case Study
por: Zhuang, Dingyi, et al.
Publicado: (2025) -
GETS: Ensemble Temperature Scaling for Calibration in Graph Neural Networks
por: Zhuang, Dingyi, et al.
Publicado: (2024) -
Generative AI for Urban Planning: Synthesizing Satellite Imagery via Diffusion Models
por: Wang, Qingyi, et al.
Publicado: (2025)