Guardado en:
| Autores principales: | Zhou, Zewei, Yang, Ruining, Xuewei, Qi, Guo, Yiluan, Chen, Sherry X., Feng, Tao, Pistunova, Kateryna, Shen, Yishan, Su, Lili, Ma, Jiaqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.19710 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving
por: Huang, Zhiyu, et al.
Publicado: (2026)
por: Huang, Zhiyu, et al.
Publicado: (2026)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
por: Zhou, Zewei, et al.
Publicado: (2025)
por: Zhou, Zewei, et al.
Publicado: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
por: Liu, Ziyan, et al.
Publicado: (2025)
por: Liu, Ziyan, et al.
Publicado: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
por: Budzianowski, Paweł, et al.
Publicado: (2025)
por: Budzianowski, Paweł, et al.
Publicado: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
por: Du, Fan, et al.
Publicado: (2026)
por: Du, Fan, et al.
Publicado: (2026)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
por: Li, Ye, et al.
Publicado: (2026)
por: Li, Ye, et al.
Publicado: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
por: Liufu, Weijia, et al.
Publicado: (2026)
por: Liufu, Weijia, et al.
Publicado: (2026)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
por: Xu, Siyu, et al.
Publicado: (2025)
por: Xu, Siyu, et al.
Publicado: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
por: Deng, Shengliang, et al.
Publicado: (2025)
por: Deng, Shengliang, et al.
Publicado: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
por: Chen, Peng, et al.
Publicado: (2025)
por: Chen, Peng, et al.
Publicado: (2025)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
por: Jin, Ruofan, et al.
Publicado: (2026)
por: Jin, Ruofan, et al.
Publicado: (2026)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
por: Hu, Yutong, et al.
Publicado: (2026)
por: Hu, Yutong, et al.
Publicado: (2026)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
por: Xu, Zonghuan, et al.
Publicado: (2025)
por: Xu, Zonghuan, et al.
Publicado: (2025)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
por: Zhang, Yuhao, et al.
Publicado: (2026)
por: Zhang, Yuhao, et al.
Publicado: (2026)
Pure Vision Language Action (VLA) Models: A Comprehensive Survey
por: Zhang, Dapeng, et al.
Publicado: (2025)
por: Zhang, Dapeng, et al.
Publicado: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
por: Li, Anqi, et al.
Publicado: (2025)
por: Li, Anqi, et al.
Publicado: (2025)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
por: Xiong, Zheng, et al.
Publicado: (2025)
por: Xiong, Zheng, et al.
Publicado: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
por: Yang, Yantai, et al.
Publicado: (2025)
por: Yang, Yantai, et al.
Publicado: (2025)
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
por: Shukor, Mustafa, et al.
Publicado: (2025)
por: Shukor, Mustafa, et al.
Publicado: (2025)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
por: Wen, Junjie, et al.
Publicado: (2024)
por: Wen, Junjie, et al.
Publicado: (2024)
CRL-VLA: Continual Vision-Language-Action Learning
por: Zeng, Qixin, et al.
Publicado: (2026)
por: Zeng, Qixin, et al.
Publicado: (2026)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
por: Dong, Shaoqi, et al.
Publicado: (2025)
por: Dong, Shaoqi, et al.
Publicado: (2025)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
por: Yu, Wenda, et al.
Publicado: (2026)
por: Yu, Wenda, et al.
Publicado: (2026)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
por: Shen, Boyang, et al.
Publicado: (2026)
por: Shen, Boyang, et al.
Publicado: (2026)
TIC-VLA: A Think-in-Control Vision-Language-Action Model for Robot Navigation in Dynamic Environments
por: Huang, Zhiyu, et al.
Publicado: (2026)
por: Huang, Zhiyu, et al.
Publicado: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
por: Sun, Jingwen, et al.
Publicado: (2026)
por: Sun, Jingwen, et al.
Publicado: (2026)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
por: Wu, Yuze, et al.
Publicado: (2025)
por: Wu, Yuze, et al.
Publicado: (2025)
Lite VLA: Efficient Vision-Language-Action Control on CPU-Bound Edge Robots
por: Williams, Justin, et al.
Publicado: (2025)
por: Williams, Justin, et al.
Publicado: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
por: Liang, Zhixuan, et al.
Publicado: (2025)
por: Liang, Zhixuan, et al.
Publicado: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
por: Li, Boyu, et al.
Publicado: (2026)
por: Li, Boyu, et al.
Publicado: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
por: Yuan, Tianyuan, et al.
Publicado: (2025)
por: Yuan, Tianyuan, et al.
Publicado: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
por: Kim, Moo Jin, et al.
Publicado: (2024)
por: Kim, Moo Jin, et al.
Publicado: (2024)
QuoVLA: Quotient Space for Vision-Language-Action Models
por: Wang, Xuan, et al.
Publicado: (2026)
por: Wang, Xuan, et al.
Publicado: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
por: Ding, Pengxiang, et al.
Publicado: (2023)
por: Ding, Pengxiang, et al.
Publicado: (2023)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
Ejemplares similares
-
nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving
por: Huang, Zhiyu, et al.
Publicado: (2026) -
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
por: Zhou, Zewei, et al.
Publicado: (2025) -
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
por: Liu, Ziyan, et al.
Publicado: (2025) -
EdgeVLA: Efficient Vision-Language-Action Models
por: Budzianowski, Paweł, et al.
Publicado: (2025) -
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
por: Du, Fan, et al.
Publicado: (2026)