ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Wencheng, Wang, Tianshi, Zhu, Lei, Li, Fengling, Yang, Guoli, Shen, Hengtao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026)
par: Liu, Chenyv, et autres
Publié: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
par: Ling, Yiran, et autres
Publié: (2026)
par: Ling, Yiran, et autres
Publié: (2026)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
par: Zhao, Ruiteng, et autres
Publié: (2026)
par: Zhao, Ruiteng, et autres
Publié: (2026)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
par: Yu, Wenda, et autres
Publié: (2026)
par: Yu, Wenda, et autres
Publié: (2026)
DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models
par: Xu, Siyuan, et autres
Publié: (2026)
par: Xu, Siyuan, et autres
Publié: (2026)
S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight
par: Yan, Haodong, et autres
Publié: (2026)
par: Yan, Haodong, et autres
Publié: (2026)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
par: Xu, Kechun, et autres
Publié: (2025)
par: Xu, Kechun, et autres
Publié: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
par: Izzo, Riccardo Andrea, et autres
Publié: (2026)
par: Izzo, Riccardo Andrea, et autres
Publié: (2026)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
par: Dong, Shaoqi, et autres
Publié: (2025)
par: Dong, Shaoqi, et autres
Publié: (2025)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)
par: Xiao, Wenli, et autres
Publié: (2025)
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
par: Wang, Guokang, et autres
Publié: (2024)
par: Wang, Guokang, et autres
Publié: (2024)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
par: Qiu, Weikang, et autres
Publié: (2026)
par: Qiu, Weikang, et autres
Publié: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
par: Lin, Yihan, et autres
Publié: (2026)
par: Lin, Yihan, et autres
Publié: (2026)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation
par: Song, Sangmim, et autres
Publié: (2026)
par: Song, Sangmim, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
par: Li, Hengtao, et autres
Publié: (2025)
par: Li, Hengtao, et autres
Publié: (2025)
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2026)
par: Huang, Chi-Pin, et autres
Publié: (2026)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
par: GigaBrain Team, et autres
Publié: (2025)
par: GigaBrain Team, et autres
Publié: (2025)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
par: Lin, Tao, et autres
Publié: (2026)
par: Lin, Tao, et autres
Publié: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
par: Zhang, Dapeng, et autres
Publié: (2025)
par: Zhang, Dapeng, et autres
Publié: (2025)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
par: Tang, Zuojin, et autres
Publié: (2026)
par: Tang, Zuojin, et autres
Publié: (2026)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
par: Yang, Yurou, et autres
Publié: (2026)
par: Yang, Yurou, et autres
Publié: (2026)
A Survey on Vision-Language-Action Models for Autonomous Driving
par: Jiang, Sicong, et autres
Publié: (2025)
par: Jiang, Sicong, et autres
Publié: (2025)
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
par: Fang, Irving, et autres
Publié: (2025)
par: Fang, Irving, et autres
Publié: (2025)
Documents similaires
-
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026) -
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
par: Ling, Yiran, et autres
Publié: (2026) -
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
par: Zhao, Ruiteng, et autres
Publié: (2026) -
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
par: Yu, Wenda, et autres
Publié: (2026) -
DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models
par: Xu, Siyuan, et autres
Publié: (2026)