StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Fu, Yiyang, Zhang, Chubin, Gong, Shukai, Deng, Yufan, Sun, Kaiwei, Min, Qiyang, Hou, Qibin, Tang, Yansong, Wang, Jianan, Zhou, Daquan
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911694059470848
author Fu, Yiyang
Zhang, Chubin
Gong, Shukai
Deng, Yufan
Sun, Kaiwei
Min, Qiyang
Hou, Qibin
Tang, Yansong
Wang, Jianan
Zhou, Daquan
author_facet Fu, Yiyang
Zhang, Chubin
Gong, Shukai
Deng, Yufan
Sun, Kaiwei
Min, Qiyang
Hou, Qibin
Tang, Yansong
Wang, Jianan
Zhou, Daquan
contents It is infeasible to encompass all possible disturbances within the training dataset. This raises a critical question regarding the robustness of Vision-Language-Action (VLA) models when encountering unseen real-world visual disturbances, particularly under imperfect visual conditions. In this work, we conduct a systematic study based on recent state-of-the-art VLA models and reveal a significant performance drop when visual disturbances absent from the training data are introduced. To mitigate this issue, we propose a lightweight adapter module grounded in information theory, termed the Information Bottleneck Adapter (IB-Adapter), which selectively filters potential noise from visual inputs. Without requiring any extra data or augmentation strategies, IB-Adapter consistently improves over the baseline by an average of 30%, while adding fewer than 10M parameters, demonstrating notable efficiency and effectiveness. Furthermore, even with a 14x smaller backbone (0.5B parameters) and no pre-training on the Open X-Embodiment dataset, our model StableVLA achieves robustness competitive with 7B-scale state-of-the-art VLAs. With negligible parameter overhead (<10M), our approach maintains accuracy on long-horizon tasks and surpasses OpenPi under both synthetic and physical visual corruptions.
format Preprint
id arxiv_https___arxiv_org_abs_2605_18287
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
Fu, Yiyang
Zhang, Chubin
Gong, Shukai
Deng, Yufan
Sun, Kaiwei
Min, Qiyang
Hou, Qibin
Tang, Yansong
Wang, Jianan
Zhou, Daquan
Computer Vision and Pattern Recognition
Robotics
It is infeasible to encompass all possible disturbances within the training dataset. This raises a critical question regarding the robustness of Vision-Language-Action (VLA) models when encountering unseen real-world visual disturbances, particularly under imperfect visual conditions. In this work, we conduct a systematic study based on recent state-of-the-art VLA models and reveal a significant performance drop when visual disturbances absent from the training data are introduced. To mitigate this issue, we propose a lightweight adapter module grounded in information theory, termed the Information Bottleneck Adapter (IB-Adapter), which selectively filters potential noise from visual inputs. Without requiring any extra data or augmentation strategies, IB-Adapter consistently improves over the baseline by an average of 30%, while adding fewer than 10M parameters, demonstrating notable efficiency and effectiveness. Furthermore, even with a 14x smaller backbone (0.5B parameters) and no pre-training on the Open X-Embodiment dataset, our model StableVLA achieves robustness competitive with 7B-scale state-of-the-art VLAs. With negligible parameter overhead (<10M), our approach maintains accuracy on long-horizon tasks and surpasses OpenPi under both synthetic and physical visual corruptions.
title StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
topic Computer Vision and Pattern Recognition
Robotics
url https://arxiv.org/abs/2605.18287