Spatial-aware Vision Language Model for Autonomous Driving
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Weijie, Luo, Zhipeng, Feng, Ling, Liong, Venice Erin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
nuScenes Revisited: Progress and Challenges in Autonomous Driving
por: Fong, Whye Kit, et al.
Publicado: (2025)
por: Fong, Whye Kit, et al.
Publicado: (2025)
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
por: Wu, Aodi, et al.
Publicado: (2025)
por: Wu, Aodi, et al.
Publicado: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
por: Tian, Xiaoyu, et al.
Publicado: (2024)
por: Tian, Xiaoyu, et al.
Publicado: (2024)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
por: Zhang, Ruifei, et al.
Publicado: (2025)
por: Zhang, Ruifei, et al.
Publicado: (2025)
Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving
por: Jiang, Hao, et al.
Publicado: (2025)
por: Jiang, Hao, et al.
Publicado: (2025)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
por: Zhang, Tianyuan, et al.
Publicado: (2024)
por: Zhang, Tianyuan, et al.
Publicado: (2024)
Maps for Autonomous Driving: Full-process Survey and Frontiers
por: Chen, Pengxin, et al.
Publicado: (2025)
por: Chen, Pengxin, et al.
Publicado: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
por: Wang, Guoqing, et al.
Publicado: (2026)
por: Wang, Guoqing, et al.
Publicado: (2026)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
por: Zhang, Yiwei, et al.
Publicado: (2026)
por: Zhang, Yiwei, et al.
Publicado: (2026)
VLP: Vision Language Planning for Autonomous Driving
por: Pan, Chenbin, et al.
Publicado: (2024)
por: Pan, Chenbin, et al.
Publicado: (2024)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
por: Diao, Muxi, et al.
Publicado: (2025)
por: Diao, Muxi, et al.
Publicado: (2025)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
por: Sun, Bin, et al.
Publicado: (2025)
por: Sun, Bin, et al.
Publicado: (2025)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
por: Liu, Zhe, et al.
Publicado: (2025)
por: Liu, Zhe, et al.
Publicado: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)
por: Tian, Kexin, et al.
Publicado: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
por: Jiang, Bo, et al.
Publicado: (2024)
por: Jiang, Bo, et al.
Publicado: (2024)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
por: Zhao, Zongchuang, et al.
Publicado: (2025)
por: Zhao, Zongchuang, et al.
Publicado: (2025)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
por: Song, Nan, et al.
Publicado: (2025)
por: Song, Nan, et al.
Publicado: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
por: Xiong, Minhao, et al.
Publicado: (2025)
por: Xiong, Minhao, et al.
Publicado: (2025)
MARS: An Instance-aware, Modular and Realistic Simulator for Autonomous Driving
por: Wu, Zirui, et al.
Publicado: (2023)
por: Wu, Zirui, et al.
Publicado: (2023)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
Spatial Retrieval Augmented Autonomous Driving
por: Jia, Xiaosong, et al.
Publicado: (2025)
por: Jia, Xiaosong, et al.
Publicado: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
por: Guo, Xianda, et al.
Publicado: (2024)
por: Guo, Xianda, et al.
Publicado: (2024)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2025)
por: Wang, Shihao, et al.
Publicado: (2025)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
por: Yang, Lijin, et al.
Publicado: (2026)
por: Yang, Lijin, et al.
Publicado: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2024)
por: Wang, Shihao, et al.
Publicado: (2024)
X-Driver: Explainable Autonomous Driving with Vision-Language Models
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
WiseAD: Knowledge Augmented End-to-End Autonomous Driving with Vision-Language Model
por: Zhang, Songyan, et al.
Publicado: (2024)
por: Zhang, Songyan, et al.
Publicado: (2024)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
por: Wang, Jie, et al.
Publicado: (2026)
por: Wang, Jie, et al.
Publicado: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
por: Jiang, Sicong, et al.
Publicado: (2025)
por: Jiang, Sicong, et al.
Publicado: (2025)
FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving
por: Guo, Mingzhe, et al.
Publicado: (2026)
por: Guo, Mingzhe, et al.
Publicado: (2026)
Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
por: Kong, Dehong, et al.
Publicado: (2025)
por: Kong, Dehong, et al.
Publicado: (2025)
Vision Language Models in Autonomous Driving: A Survey and Outlook
por: Zhou, Xingcheng, et al.
Publicado: (2023)
por: Zhou, Xingcheng, et al.
Publicado: (2023)
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities
por: Yan, Xu, et al.
Publicado: (2024)
por: Yan, Xu, et al.
Publicado: (2024)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
por: Chen, Xuesong, et al.
Publicado: (2025)
por: Chen, Xuesong, et al.
Publicado: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
por: Fu, Haoyu, et al.
Publicado: (2025)
por: Fu, Haoyu, et al.
Publicado: (2025)
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
por: Wang, Jiayun, et al.
Publicado: (2026)
por: Wang, Jiayun, et al.
Publicado: (2026)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
por: jia, Feiyang, et al.
Publicado: (2026)
por: jia, Feiyang, et al.
Publicado: (2026)
Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving
por: Keser, Mert, et al.
Publicado: (2025)
por: Keser, Mert, et al.
Publicado: (2025)
Ejemplares similares
-
nuScenes Revisited: Progress and Challenges in Autonomous Driving
por: Fong, Whye Kit, et al.
Publicado: (2025) -
Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning
por: Wu, Aodi, et al.
Publicado: (2025) -
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
por: Tian, Xiaoyu, et al.
Publicado: (2024) -
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
por: Zhou, Xingcheng, et al.
Publicado: (2025) -
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
por: Zhang, Ruifei, et al.
Publicado: (2025)