Transferring Vision-Language-Action Models to Industry Applications: Architectures, Performance, and Challenges
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Shuai, Yizhe, Chen, Dong, Li, Sichao, Liu, Dapeng, Lan, Yu, Liu, Pang, Zhibo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Liaohe-CobotMagic-PnP: an Imitation Learning Dataset of Intelligent Robot for Industrial Applications
por: Yizhe, Chen, et al.
Publicado: (2025)
por: Yizhe, Chen, et al.
Publicado: (2025)
MMET: A Multi-Input and Multi-Scale Transformer for Efficient PDEs Solving
por: Luo, Yichen, et al.
Publicado: (2025)
por: Luo, Yichen, et al.
Publicado: (2025)
Survey of Vision-Language-Action Models for Embodied Manipulation
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
10 Open Challenges Steering the Future of Vision-Language-Action Models
por: Poria, Soujanya, et al.
Publicado: (2025)
por: Poria, Soujanya, et al.
Publicado: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
por: Zhang, Dapeng, et al.
Publicado: (2025)
por: Zhang, Dapeng, et al.
Publicado: (2025)
CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
por: Liu, Youzhi, et al.
Publicado: (2026)
por: Liu, Youzhi, et al.
Publicado: (2026)
Emergence of Human to Robot Transfer in Vision-Language-Action Models
por: Kareer, Simar, et al.
Publicado: (2025)
por: Kareer, Simar, et al.
Publicado: (2025)
NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models
por: Gong, Haisong, et al.
Publicado: (2026)
por: Gong, Haisong, et al.
Publicado: (2026)
Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture
por: Lu, Hong, et al.
Publicado: (2025)
por: Lu, Hong, et al.
Publicado: (2025)
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
por: Zhang, Zhengshen, et al.
Publicado: (2025)
por: Zhang, Zhengshen, et al.
Publicado: (2025)
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
por: Liu, Ruixun, et al.
Publicado: (2025)
por: Liu, Ruixun, et al.
Publicado: (2025)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
por: Hu, Xintong, et al.
Publicado: (2026)
por: Hu, Xintong, et al.
Publicado: (2026)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
por: Wang, Qiuyue, et al.
Publicado: (2026)
por: Wang, Qiuyue, et al.
Publicado: (2026)
RETAIL: Towards Real-world Travel Planning for Large Language Models
por: Deng, Bin, et al.
Publicado: (2025)
por: Deng, Bin, et al.
Publicado: (2025)
A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
por: Zhai, Shaopeng, et al.
Publicado: (2025)
por: Zhai, Shaopeng, et al.
Publicado: (2025)
SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
por: Fang, Hengyu, et al.
Publicado: (2025)
por: Fang, Hengyu, et al.
Publicado: (2025)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition
por: Han, Gaoge, et al.
Publicado: (2026)
por: Han, Gaoge, et al.
Publicado: (2026)
Automatic and Universal Prompt Injection Attacks against Large Language Models
por: Liu, Xiaogeng, et al.
Publicado: (2024)
por: Liu, Xiaogeng, et al.
Publicado: (2024)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
por: Yang, Rushuai, et al.
Publicado: (2026)
por: Yang, Rushuai, et al.
Publicado: (2026)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
por: Xu, Zonghuan, et al.
Publicado: (2025)
por: Xu, Zonghuan, et al.
Publicado: (2025)
LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
por: Hong, Youngjin, et al.
Publicado: (2025)
por: Hong, Youngjin, et al.
Publicado: (2025)
Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment
por: Zhou, Kaijun, et al.
Publicado: (2026)
por: Zhou, Kaijun, et al.
Publicado: (2026)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
por: Chen, Xiaoyu, et al.
Publicado: (2025)
por: Chen, Xiaoyu, et al.
Publicado: (2025)
Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models
por: Yang, Huoren, et al.
Publicado: (2026)
por: Yang, Huoren, et al.
Publicado: (2026)
Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning
por: Shen, Weijie, et al.
Publicado: (2025)
por: Shen, Weijie, et al.
Publicado: (2025)
Compiled Models, Built-In Exploits: Uncovering Pervasive Bit-Flip Attack Surfaces in DNN Executables
por: Chen, Yanzuo, et al.
Publicado: (2023)
por: Chen, Yanzuo, et al.
Publicado: (2023)
Large Language Models in Operations Research: Methods, Applications, and Challenges
por: Wang, Yang, et al.
Publicado: (2025)
por: Wang, Yang, et al.
Publicado: (2025)
VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
por: Liu, Pang, et al.
Publicado: (2026)
por: Liu, Pang, et al.
Publicado: (2026)
Action Hallucination in Generative Vision-Language-Action Models
por: Soh, Harold, et al.
Publicado: (2026)
por: Soh, Harold, et al.
Publicado: (2026)
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
por: Tang, Yehui, et al.
Publicado: (2024)
por: Tang, Yehui, et al.
Publicado: (2024)
Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
por: Liu, Huihan, et al.
Publicado: (2026)
por: Liu, Huihan, et al.
Publicado: (2026)
Vision-Language Model Selection and Reuse for Downstream Adaptation
por: Tan, Hao-Zhe, et al.
Publicado: (2025)
por: Tan, Hao-Zhe, et al.
Publicado: (2025)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
por: Tao, Xijia, et al.
Publicado: (2024)
por: Tao, Xijia, et al.
Publicado: (2024)
Recursive Belief Vision Language Action Models
por: Bagaria, Vaidehi, et al.
Publicado: (2026)
por: Bagaria, Vaidehi, et al.
Publicado: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
por: Si, Shengyu, et al.
Publicado: (2026)
por: Si, Shengyu, et al.
Publicado: (2026)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
por: Zheng, Jinliang, et al.
Publicado: (2025)
por: Zheng, Jinliang, et al.
Publicado: (2025)
Ejemplares similares
-
Liaohe-CobotMagic-PnP: an Imitation Learning Dataset of Intelligent Robot for Industrial Applications
por: Yizhe, Chen, et al.
Publicado: (2025) -
MMET: A Multi-Input and Multi-Scale Transformer for Efficient PDEs Solving
por: Luo, Yichen, et al.
Publicado: (2025) -
Survey of Vision-Language-Action Models for Embodied Manipulation
por: Li, Haoran, et al.
Publicado: (2025) -
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025) -
10 Open Challenges Steering the Future of Vision-Language-Action Models
por: Poria, Soujanya, et al.
Publicado: (2025)