StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Community, StarVLA |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026)
par: Shen, Boyang, et autres
Publié: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
par: Si, Shengyu, et autres
Publié: (2026)
par: Si, Shengyu, et autres
Publié: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
par: Wang, Chaoyang, et autres
Publié: (2026)
par: Wang, Chaoyang, et autres
Publié: (2026)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
par: Gao, Chongkai, et autres
Publié: (2025)
par: Gao, Chongkai, et autres
Publié: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
par: Wang, Hanzhen, et autres
Publié: (2025)
par: Wang, Hanzhen, et autres
Publié: (2025)
OG-VLA: Orthographic Image Generation for 3D-Aware Vision-Language Action Model
par: Singh, Ishika, et autres
Publié: (2025)
par: Singh, Ishika, et autres
Publié: (2025)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
par: Zheng, Jinliang, et autres
Publié: (2025)
par: Zheng, Jinliang, et autres
Publié: (2025)
AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control
par: Xu, Peng, et autres
Publié: (2026)
par: Xu, Peng, et autres
Publié: (2026)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
par: Wang, Yiru, et autres
Publié: (2026)
par: Wang, Yiru, et autres
Publié: (2026)
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
par: Sarowar, Md Selim, et autres
Publié: (2026)
par: Sarowar, Md Selim, et autres
Publié: (2026)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
3D-VLA: A 3D Vision-Language-Action Generative World Model
par: Zhen, Haoyu, et autres
Publié: (2024)
par: Zhen, Haoyu, et autres
Publié: (2024)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
ChainFlow-VLA: Causal Flow Planning with Vision-Language Models
par: Wang, Xiyang, et autres
Publié: (2026)
par: Wang, Xiyang, et autres
Publié: (2026)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
par: Liu, Chenghao, et autres
Publié: (2025)
par: Liu, Chenghao, et autres
Publié: (2025)
DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
par: Tang, Zuojin, et autres
Publié: (2026)
par: Tang, Zuojin, et autres
Publié: (2026)
UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation
par: Sautenkov, Oleg, et autres
Publié: (2025)
par: Sautenkov, Oleg, et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Autonomous Driving
par: Jiang, Sicong, et autres
Publié: (2025)
par: Jiang, Sicong, et autres
Publié: (2025)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
par: Wang, Guodong, et autres
Publié: (2026)
par: Wang, Guodong, et autres
Publié: (2026)
From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings
par: Zhang, Jiajie, et autres
Publié: (2025)
par: Zhang, Jiajie, et autres
Publié: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)
par: Kim, Ju-Young, et autres
Publié: (2025)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
par: Guo, Jianing, et autres
Publié: (2025)
par: Guo, Jianing, et autres
Publié: (2025)
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026)
par: Liu, Chenyv, et autres
Publié: (2026)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
par: Hung, Chia-Yu, et autres
Publié: (2025)
par: Hung, Chia-Yu, et autres
Publié: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
par: Lei, Zixing, et autres
Publié: (2026)
par: Lei, Zixing, et autres
Publié: (2026)
VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting
par: Lin, Juyi, et autres
Publié: (2025)
par: Lin, Juyi, et autres
Publié: (2025)
ROSA: Harnessing Robot States for Vision-Language and Action Alignment
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
par: Peng, Jierui, et autres
Publié: (2025)
par: Peng, Jierui, et autres
Publié: (2025)
Hybrid Training for Vision-Language-Action Models
par: Mazzaglia, Pietro, et autres
Publié: (2025)
par: Mazzaglia, Pietro, et autres
Publié: (2025)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
par: Yang, Zhenjie, et autres
Publié: (2025)
par: Yang, Zhenjie, et autres
Publié: (2025)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
par: Fan, Qingyu, et autres
Publié: (2026)
par: Fan, Qingyu, et autres
Publié: (2026)
Documents similaires
-
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
par: Ye, Jinhui, et autres
Publié: (2026) -
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025) -
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026) -
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
par: Si, Shengyu, et autres
Publié: (2026) -
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
par: Wang, Chaoyang, et autres
Publié: (2026)