Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kawaharazuka, Kento, Oh, Jihoon, Yamada, Jun, Posner, Ingmar, Zhu, Yuke |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Real-World Robot Applications of Foundation Models: A Review
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)
par: Kim, Ju-Young, et autres
Publié: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
ROSA: Harnessing Robot States for Vision-Language and Action Alignment
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
Vision Language Action Models in Robotic Manipulation: A Systematic Review
par: Din, Muhayy Ud, et autres
Publié: (2025)
par: Din, Muhayy Ud, et autres
Publié: (2025)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
par: Li, Qixiu, et autres
Publié: (2025)
par: Li, Qixiu, et autres
Publié: (2025)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
LUMOS: Language-Conditioned Imitation Learning with World Models
par: Nematollahi, Iman, et autres
Publié: (2025)
par: Nematollahi, Iman, et autres
Publié: (2025)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
par: Lei, Zixing, et autres
Publié: (2026)
par: Lei, Zixing, et autres
Publié: (2026)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
par: Zhou, Enshen, et autres
Publié: (2025)
par: Zhou, Enshen, et autres
Publié: (2025)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
par: Duan, Jiafei, et autres
Publié: (2024)
par: Duan, Jiafei, et autres
Publié: (2024)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
par: Tang, Zuojin, et autres
Publié: (2026)
par: Tang, Zuojin, et autres
Publié: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
par: Jiang, Sicong, et autres
Publié: (2025)
par: Jiang, Sicong, et autres
Publié: (2025)
Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
par: Kim, Jisoo, et autres
Publié: (2026)
par: Kim, Jisoo, et autres
Publié: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
par: Sun, Jingwen, et autres
Publié: (2026)
par: Sun, Jingwen, et autres
Publié: (2026)
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
par: Wei, Ziyu, et autres
Publié: (2026)
par: Wei, Ziyu, et autres
Publié: (2026)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
par: Li, Zaijing, et autres
Publié: (2026)
par: Li, Zaijing, et autres
Publié: (2026)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
par: Liu, Mengzhen, et autres
Publié: (2026)
par: Liu, Mengzhen, et autres
Publié: (2026)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
par: Wang, Guodong, et autres
Publié: (2026)
par: Wang, Guodong, et autres
Publié: (2026)
A Systematic Literature Review of Computer Vision Applications in Robotized Wire Harness Assembly
par: Wang, Hao, et autres
Publié: (2023)
par: Wang, Hao, et autres
Publié: (2023)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
Physically Grounded Vision-Language Models for Robotic Manipulation
par: Gao, Jensen, et autres
Publié: (2023)
par: Gao, Jensen, et autres
Publié: (2023)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)
par: Xiao, Wenli, et autres
Publié: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
par: Guo, Jianing, et autres
Publié: (2025)
par: Guo, Jianing, et autres
Publié: (2025)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
par: GigaBrain Team, et autres
Publié: (2025)
par: GigaBrain Team, et autres
Publié: (2025)
VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model
par: Wang, Beichen, et autres
Publié: (2024)
par: Wang, Beichen, et autres
Publié: (2024)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
par: Yang, Zhenjie, et autres
Publié: (2025)
par: Yang, Zhenjie, et autres
Publié: (2025)
WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
par: Chen, Hongjin, et autres
Publié: (2026)
par: Chen, Hongjin, et autres
Publié: (2026)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
par: Wang, Hanzhen, et autres
Publié: (2025)
par: Wang, Hanzhen, et autres
Publié: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
par: Shen, Boyang, et autres
Publié: (2026)
par: Shen, Boyang, et autres
Publié: (2026)
3D-VLA: A 3D Vision-Language-Action Generative World Model
par: Zhen, Haoyu, et autres
Publié: (2024)
par: Zhen, Haoyu, et autres
Publié: (2024)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
par: Yin, Zhenhan, et autres
Publié: (2025)
par: Yin, Zhenhan, et autres
Publié: (2025)
Documents similaires
-
Real-World Robot Applications of Foundation Models: A Review
par: Kawaharazuka, Kento, et autres
Publié: (2024) -
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024) -
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024) -
Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024) -
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)