Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Hu, Tianshuai, Liu, Xiaolu, Wang, Song, Zhu, Yiyao, Liang, Ao, Kong, Lingdong, Zhao, Guoyang, Gong, Zeying, Cen, Jun, Huang, Zhiyu, Hao, Xiaoshuai, Li, Linfeng, Song, Hang, Li, Xiangtai, Ma, Jun, Shen, Shaojie, Zhu, Jianke, Tao, Dacheng, Liu, Ziwei, Liang, Junwei
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866909980815261696
author Hu, Tianshuai
Liu, Xiaolu
Wang, Song
Zhu, Yiyao
Liang, Ao
Kong, Lingdong
Zhao, Guoyang
Gong, Zeying
Cen, Jun
Huang, Zhiyu
Hao, Xiaoshuai
Li, Linfeng
Song, Hang
Li, Xiangtai
Ma, Jun
Shen, Shaojie
Zhu, Jianke
Tao, Dacheng
Liu, Ziwei
Liang, Junwei
author_facet Hu, Tianshuai
Liu, Xiaolu
Wang, Song
Zhu, Yiyao
Liang, Ao
Kong, Lingdong
Zhao, Guoyang
Gong, Zeying
Cen, Jun
Huang, Zhiyu
Hao, Xiaoshuai
Li, Linfeng
Song, Hang
Li, Xiangtai
Ma, Jun
Shen, Shaojie
Zhu, Jianke
Tao, Dacheng
Liu, Ziwei
Liang, Junwei
contents Autonomous driving has long relied on modular "Perception-Decision-Action" pipelines, where hand-crafted interfaces and rule-based components often break down in complex or long-tailed scenarios. Their cascaded design further propagates perception errors, degrading downstream planning and control. Vision-Action (VA) models address some limitations by learning direct mappings from visual inputs to actions, but they remain opaque, sensitive to distribution shifts, and lack structured reasoning or instruction-following capabilities. Recent progress in Large Language Models (LLMs) and multimodal learning has motivated the emergence of Vision-Language-Action (VLA) frameworks, which integrate perception with language-grounded decision making. By unifying visual understanding, linguistic reasoning, and actionable outputs, VLAs offer a pathway toward more interpretable, generalizable, and human-aligned driving policies. This work provides a structured characterization of the emerging VLA landscape for autonomous driving. We trace the evolution from early VA approaches to modern VLA frameworks and organize existing methods into two principal paradigms: End-to-End VLA, which integrates perception, reasoning, and planning within a single model, and Dual-System VLA, which separates slow deliberation (via VLMs) from fast, safety-critical execution (via planners). Within these paradigms, we further distinguish subclasses such as textual vs. numerical action generators and explicit vs. implicit guidance mechanisms. We also summarize representative datasets and benchmarks for evaluating VLA-based driving systems and highlight key challenges and open directions, including robustness, interpretability, and instruction fidelity. Overall, this work aims to establish a coherent foundation for advancing human-compatible autonomous driving systems.
format Preprint
id arxiv_https___arxiv_org_abs_2512_16760
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
Hu, Tianshuai
Liu, Xiaolu
Wang, Song
Zhu, Yiyao
Liang, Ao
Kong, Lingdong
Zhao, Guoyang
Gong, Zeying
Cen, Jun
Huang, Zhiyu
Hao, Xiaoshuai
Li, Linfeng
Song, Hang
Li, Xiangtai
Ma, Jun
Shen, Shaojie
Zhu, Jianke
Tao, Dacheng
Liu, Ziwei
Liang, Junwei
Robotics
Autonomous driving has long relied on modular "Perception-Decision-Action" pipelines, where hand-crafted interfaces and rule-based components often break down in complex or long-tailed scenarios. Their cascaded design further propagates perception errors, degrading downstream planning and control. Vision-Action (VA) models address some limitations by learning direct mappings from visual inputs to actions, but they remain opaque, sensitive to distribution shifts, and lack structured reasoning or instruction-following capabilities. Recent progress in Large Language Models (LLMs) and multimodal learning has motivated the emergence of Vision-Language-Action (VLA) frameworks, which integrate perception with language-grounded decision making. By unifying visual understanding, linguistic reasoning, and actionable outputs, VLAs offer a pathway toward more interpretable, generalizable, and human-aligned driving policies. This work provides a structured characterization of the emerging VLA landscape for autonomous driving. We trace the evolution from early VA approaches to modern VLA frameworks and organize existing methods into two principal paradigms: End-to-End VLA, which integrates perception, reasoning, and planning within a single model, and Dual-System VLA, which separates slow deliberation (via VLMs) from fast, safety-critical execution (via planners). Within these paradigms, we further distinguish subclasses such as textual vs. numerical action generators and explicit vs. implicit guidance mechanisms. We also summarize representative datasets and benchmarks for evaluating VLA-based driving systems and highlight key challenges and open directions, including robustness, interpretability, and instruction fidelity. Overall, this work aims to establish a coherent foundation for advancing human-compatible autonomous driving systems.
title Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
topic Robotics
url https://arxiv.org/abs/2512.16760