ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Ye, Liu, Huanan, Ji, Kangye, Meng, Yuan, Fan, Jiajun, Wang, Yuansong, Qin, Shiyu, Wu, Chenglei, Xia, Shu-Tao, Wang, Zhi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
par: Li, Ye, et autres
Publié: (2025)
par: Li, Ye, et autres
Publié: (2025)
Test-time Sparsity for Extreme Fast Action Diffusion
par: Ji, Kangye, et autres
Publié: (2026)
par: Ji, Kangye, et autres
Publié: (2026)
Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning
par: Ji, Kangye, et autres
Publié: (2026)
par: Ji, Kangye, et autres
Publié: (2026)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
par: Luo, Yuechen, et autres
Publié: (2026)
par: Luo, Yuechen, et autres
Publié: (2026)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
par: Xu, Siyu, et autres
Publié: (2025)
par: Xu, Siyu, et autres
Publié: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
Synthetic Data is an Elegant GIFT for Continual Vision-Language Models
par: Wu, Bin, et autres
Publié: (2025)
par: Wu, Bin, et autres
Publié: (2025)
RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
par: Huang, Yuzhi, et autres
Publié: (2026)
par: Huang, Yuzhi, et autres
Publié: (2026)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
par: Du, Fan, et autres
Publié: (2026)
par: Du, Fan, et autres
Publié: (2026)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
par: Yin, Cheng, et autres
Publié: (2025)
par: Yin, Cheng, et autres
Publié: (2025)
TS-DP: Reinforcement Speculative Decoding For Temporal Adaptive Diffusion Policy Acceleration
par: Li, Ye, et autres
Publié: (2025)
par: Li, Ye, et autres
Publié: (2025)
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
par: Zhai, Jiajun, et autres
Publié: (2026)
par: Zhai, Jiajun, et autres
Publié: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
par: Wang, Chaoyang, et autres
Publié: (2026)
par: Wang, Chaoyang, et autres
Publié: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
Block-wise Adaptive Caching for Accelerating Diffusion Policy
par: Ji, Kangye, et autres
Publié: (2025)
par: Ji, Kangye, et autres
Publié: (2025)
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
par: Budzianowski, Paweł, et autres
Publié: (2025)
par: Budzianowski, Paweł, et autres
Publié: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
CASL: Curvature-Augmented Self-supervised Learning for 3D Anomaly Detection
par: Zha, Yaohua, et autres
Publié: (2025)
par: Zha, Yaohua, et autres
Publié: (2025)
When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling
par: Zhou, Shu, et autres
Publié: (2026)
par: Zhou, Shu, et autres
Publié: (2026)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
par: Xiong, Zheng, et autres
Publié: (2025)
par: Xiong, Zheng, et autres
Publié: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
RynnVLA-002: A Unified Vision-Language-Action and World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025)
par: Yang, Yantai, et autres
Publié: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
par: Zeng, Qixin, et autres
Publié: (2026)
par: Zeng, Qixin, et autres
Publié: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
par: Chen, Peng, et autres
Publié: (2025)
par: Chen, Peng, et autres
Publié: (2025)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
par: Wang, Songsheng, et autres
Publié: (2025)
par: Wang, Songsheng, et autres
Publié: (2025)
CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models
par: Liu, Zhi
Publié: (2026)
par: Liu, Zhi
Publié: (2026)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
VLA-AN: An Efficient and Onboard Vision-Language-Action Framework for Aerial Navigation in Complex Environments
par: Wu, Yuze, et autres
Publié: (2025)
par: Wu, Yuze, et autres
Publié: (2025)
$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation
par: Zhu, Yijie, et autres
Publié: (2026)
par: Zhu, Yijie, et autres
Publié: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
par: Zhou, Zewei, et autres
Publié: (2026)
par: Zhou, Zewei, et autres
Publié: (2026)
LightCL: Compact Continual Learning with Low Memory Footprint For Edge Device
par: Wang, Zeqing, et autres
Publié: (2024)
par: Wang, Zeqing, et autres
Publié: (2024)
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
par: Jin, Ruofan, et autres
Publié: (2026)
par: Jin, Ruofan, et autres
Publié: (2026)
Documents similaires
-
SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
par: Li, Ye, et autres
Publié: (2025) -
Test-time Sparsity for Extreme Fast Action Diffusion
par: Ji, Kangye, et autres
Publié: (2026) -
Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning
par: Ji, Kangye, et autres
Publié: (2026) -
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
par: Luo, Yuechen, et autres
Publié: (2026) -
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
par: Xu, Siyu, et autres
Publié: (2025)