SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Xianda, Zhang, Ruijun, Duan, Yiqun, He, Yuhang, Nie, Dujun, Huang, Wenke, Zhang, Chenming, Liu, Shuai, Zhao, Hao, Chen, Long |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation
by: Nie, Dujun, et al.
Published: (2025)
by: Nie, Dujun, et al.
Published: (2025)
Instruct Large Language Models to Drive like Humans
by: Zhang, Ruijun, et al.
Published: (2024)
by: Zhang, Ruijun, et al.
Published: (2024)
LightStereo: Channel Boost Is All You Need for Efficient 2D Cost Aggregation
by: Guo, Xianda, et al.
Published: (2024)
by: Guo, Xianda, et al.
Published: (2024)
OpenStereo: A Comprehensive Benchmark for Stereo Matching and Strong Baseline
by: Guo, Xianda, et al.
Published: (2023)
by: Guo, Xianda, et al.
Published: (2023)
GenAD: Generative End-to-End Autonomous Driving
by: Zheng, Wenzhao, et al.
Published: (2024)
by: Zheng, Wenzhao, et al.
Published: (2024)
ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving
by: Guo, Xianda, et al.
Published: (2025)
by: Guo, Xianda, et al.
Published: (2025)
Stereo Anything: Unifying Zero-shot Stereo Matching with Large-Scale Mixed Data
by: Guo, Xianda, et al.
Published: (2024)
by: Guo, Xianda, et al.
Published: (2024)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
by: Tian, Kexin, et al.
Published: (2025)
by: Tian, Kexin, et al.
Published: (2025)
StereoCarla: A High-Fidelity Driving Dataset for Generalizable Stereo
by: Guo, Xianda, et al.
Published: (2025)
by: Guo, Xianda, et al.
Published: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
by: Jia, Mengdi, et al.
Published: (2025)
by: Jia, Mengdi, et al.
Published: (2025)
AdvDiffuser: Generating Adversarial Safety-Critical Driving Scenarios via Guided Diffusion
by: Xie, Yuting, et al.
Published: (2024)
by: Xie, Yuting, et al.
Published: (2024)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
by: Nie, Dujun, et al.
Published: (2026)
by: Nie, Dujun, et al.
Published: (2026)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
by: Huang, Xinmiao, et al.
Published: (2025)
by: Huang, Xinmiao, et al.
Published: (2025)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
by: Duan, Yiqun, et al.
Published: (2024)
by: Duan, Yiqun, et al.
Published: (2024)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
by: Zhang, Jiyao, et al.
Published: (2026)
by: Zhang, Jiyao, et al.
Published: (2026)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
by: Zhang, Beichen, et al.
Published: (2025)
by: Zhang, Beichen, et al.
Published: (2025)
Embodied Understanding of Driving Scenarios
by: Zhou, Yunsong, et al.
Published: (2024)
by: Zhou, Yunsong, et al.
Published: (2024)
HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
by: Wang, Daming, et al.
Published: (2025)
by: Wang, Daming, et al.
Published: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
by: Liu, Yuhong, et al.
Published: (2025)
by: Liu, Yuhong, et al.
Published: (2025)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
by: Zhang, Jiahuan, et al.
Published: (2025)
by: Zhang, Jiahuan, et al.
Published: (2025)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
by: Liu, Chenghao, et al.
Published: (2025)
by: Liu, Chenghao, et al.
Published: (2025)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
by: Jiang, Anqing, et al.
Published: (2025)
by: Jiang, Anqing, et al.
Published: (2025)
DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving
by: Ma, Enhui, et al.
Published: (2026)
by: Ma, Enhui, et al.
Published: (2026)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
by: Xie, Yuechen, et al.
Published: (2026)
by: Xie, Yuechen, et al.
Published: (2026)
Automatically Generating High-Precision Simulated Road Networking in Traffic Scenario
by: Xie, Liang, et al.
Published: (2025)
by: Xie, Liang, et al.
Published: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
by: Du, Mengfei, et al.
Published: (2024)
by: Du, Mengfei, et al.
Published: (2024)
Adjacent-view Transformers for Supervised Surround-view Depth Estimation
by: Guo, Xianda, et al.
Published: (2023)
by: Guo, Xianda, et al.
Published: (2023)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
by: Hu, Wenbo, et al.
Published: (2025)
by: Hu, Wenbo, et al.
Published: (2025)
Prompting Multi-Modal Tokens to Enhance End-to-End Autonomous Driving Imitation Learning with LLMs
by: Duan, Yiqun, et al.
Published: (2024)
by: Duan, Yiqun, et al.
Published: (2024)
Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action
by: Li, Pengteng, et al.
Published: (2026)
by: Li, Pengteng, et al.
Published: (2026)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
by: Zhao, Bingchen, et al.
Published: (2024)
by: Zhao, Bingchen, et al.
Published: (2024)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
by: Zhou, Shengchao, et al.
Published: (2025)
by: Zhou, Shengchao, et al.
Published: (2025)
DriveSplat: Unified Neural Gaussian Reconstruction for Dynamic Driving Scenes
by: Wang, Cong, et al.
Published: (2025)
by: Wang, Cong, et al.
Published: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
by: Stogiannidis, Ilias, et al.
Published: (2025)
by: Stogiannidis, Ilias, et al.
Published: (2025)
LLM-Driven Scenario-Aware Planning for Autonomous Driving
by: Li, He, et al.
Published: (2026)
by: Li, He, et al.
Published: (2026)
InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving
by: Song, Ruiqi, et al.
Published: (2025)
by: Song, Ruiqi, et al.
Published: (2025)
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
by: Zhang, Feihong, et al.
Published: (2025)
by: Zhang, Feihong, et al.
Published: (2025)
ThanoRA: Task Heterogeneity-Aware Multi-Task Low-Rank Adaptation
by: Liang, Jian, et al.
Published: (2025)
by: Liang, Jian, et al.
Published: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
by: Deng, Nianchen, et al.
Published: (2025)
by: Deng, Nianchen, et al.
Published: (2025)
Similar Items
-
WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation
by: Nie, Dujun, et al.
Published: (2025) -
Instruct Large Language Models to Drive like Humans
by: Zhang, Ruijun, et al.
Published: (2024) -
LightStereo: Channel Boost Is All You Need for Efficient 2D Cost Aggregation
by: Guo, Xianda, et al.
Published: (2024) -
OpenStereo: A Comprehensive Benchmark for Stereo Matching and Strong Baseline
by: Guo, Xianda, et al.
Published: (2023) -
GenAD: Generative End-to-End Autonomous Driving
by: Zheng, Wenzhao, et al.
Published: (2024)