DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: HU, Haibo, Huang, Lianming, Guan, Nan, Xue, Chun Jason
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918218204971008
author HU, Haibo
Huang, Lianming
Guan, Nan
Xue, Chun Jason
author_facet HU, Haibo
Huang, Lianming
Guan, Nan
Xue, Chun Jason
contents Vision-Language Action (VLA) models unify perception, reasoning, and trajectory generation for autonomous driving, but suffer from significant inference latency due to deep transformer stacks. We present DeeAD, a training-free, action-guided early-exit framework that accelerates VLA planning by evaluating the physical feasibility of intermediate trajectories. Instead of relying on confidence scores, DeeAD terminates inference when predicted trajectories align with lightweight planning priors (e.g., Navigation or Low-precision Planning) within a tolerable deviation (<2m). To improve efficiency, we introduce a multi-hop controller that adaptively skips redundant layers based on the change rate of scores. DeeAD integrates into existing VLA models, such as ORION, without requiring retraining. Experiments on the Bench2Drive benchmark demonstrate up to 28% transformer-layer sparsity and 29% latency reduction, while preserving planning quality and safety.
format Preprint
id arxiv_https___arxiv_org_abs_2511_20720
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving
HU, Haibo
Huang, Lianming
Guan, Nan
Xue, Chun Jason
Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
Robotics
Vision-Language Action (VLA) models unify perception, reasoning, and trajectory generation for autonomous driving, but suffer from significant inference latency due to deep transformer stacks. We present DeeAD, a training-free, action-guided early-exit framework that accelerates VLA planning by evaluating the physical feasibility of intermediate trajectories. Instead of relying on confidence scores, DeeAD terminates inference when predicted trajectories align with lightweight planning priors (e.g., Navigation or Low-precision Planning) within a tolerable deviation (<2m). To improve efficiency, we introduce a multi-hop controller that adaptively skips redundant layers based on the change rate of scores. DeeAD integrates into existing VLA models, such as ORION, without requiring retraining. Experiments on the Bench2Drive benchmark demonstrate up to 28% transformer-layer sparsity and 29% latency reduction, while preserving planning quality and safety.
title DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving
topic Computer Vision and Pattern Recognition
Artificial Intelligence
Machine Learning
Robotics
url https://arxiv.org/abs/2511.20720