ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhong, Linqing, Liu, Yi, Wei, Yifei, Xiong, Ziyu, Yao, Maoqing, Liu, Si, Ren, Guanghui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
von: Wei, Yifei, et al.
Veröffentlicht: (2026)
von: Wei, Yifei, et al.
Veröffentlicht: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2025)
von: Zhong, Zhide, et al.
Veröffentlicht: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025)
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
von: Bu, Qingwen, et al.
Veröffentlicht: (2025)
von: Bu, Qingwen, et al.
Veröffentlicht: (2025)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2026)
von: Zhong, Zhide, et al.
Veröffentlicht: (2026)
Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
von: Liu, Yi, et al.
Veröffentlicht: (2025)
von: Liu, Yi, et al.
Veröffentlicht: (2025)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
von: Yang, Rushuai, et al.
Veröffentlicht: (2026)
von: Yang, Rushuai, et al.
Veröffentlicht: (2026)
LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model
von: Liu, Zhuoyang, et al.
Veröffentlicht: (2026)
von: Liu, Zhuoyang, et al.
Veröffentlicht: (2026)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
von: Hu, Yutong, et al.
Veröffentlicht: (2026)
von: Hu, Yutong, et al.
Veröffentlicht: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
von: Wang, Zixuan, et al.
Veröffentlicht: (2026)
Continually Evolving Skill Knowledge in Vision Language Action Model
von: Wu, Yuxuan, et al.
Veröffentlicht: (2025)
von: Wu, Yuxuan, et al.
Veröffentlicht: (2025)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
von: Li, Meng, et al.
Veröffentlicht: (2025)
von: Li, Meng, et al.
Veröffentlicht: (2025)
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
von: Li, Jinming, et al.
Veröffentlicht: (2024)
von: Li, Jinming, et al.
Veröffentlicht: (2024)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
von: Zhu, Ziyue, et al.
Veröffentlicht: (2026)
von: Zhu, Ziyue, et al.
Veröffentlicht: (2026)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
von: Guo, Xinyu, et al.
Veröffentlicht: (2026)
von: Guo, Xinyu, et al.
Veröffentlicht: (2026)
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
von: Song, Haoming, et al.
Veröffentlicht: (2025)
von: Song, Haoming, et al.
Veröffentlicht: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
von: Deng, Shengliang, et al.
Veröffentlicht: (2025)
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
von: Luo, Jingzhou, et al.
Veröffentlicht: (2026)
von: Luo, Jingzhou, et al.
Veröffentlicht: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
von: Sun, Lin, et al.
Veröffentlicht: (2025)
von: Sun, Lin, et al.
Veröffentlicht: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
von: Wang, Yihao, et al.
Veröffentlicht: (2025)
von: Wang, Yihao, et al.
Veröffentlicht: (2025)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
von: Zang, Hongzhi, et al.
Veröffentlicht: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
von: Budzianowski, Paweł, et al.
Veröffentlicht: (2025)
von: Budzianowski, Paweł, et al.
Veröffentlicht: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
von: Li, Qiwei, et al.
Veröffentlicht: (2026)
von: Li, Qiwei, et al.
Veröffentlicht: (2026)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
von: Zhu, Xiang, et al.
Veröffentlicht: (2026)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
von: Li, Ye, et al.
Veröffentlicht: (2026)
von: Li, Ye, et al.
Veröffentlicht: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
von: Li, Boyu, et al.
Veröffentlicht: (2026)
von: Li, Boyu, et al.
Veröffentlicht: (2026)
CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human
von: Sun, Nan, et al.
Veröffentlicht: (2025)
von: Sun, Nan, et al.
Veröffentlicht: (2025)
KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition
von: Han, Gaoge, et al.
Veröffentlicht: (2026)
von: Han, Gaoge, et al.
Veröffentlicht: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
von: Li, Xiaoqi, et al.
Veröffentlicht: (2026)
von: Li, Xiaoqi, et al.
Veröffentlicht: (2026)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
von: Song, Wenxuan, et al.
Veröffentlicht: (2025)
FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2026)
von: Zhang, Yichi, et al.
Veröffentlicht: (2026)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
von: Zhang, Yuhao, et al.
Veröffentlicht: (2026)
von: Zhang, Yuhao, et al.
Veröffentlicht: (2026)
Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
von: Apanasevich, I., et al.
Veröffentlicht: (2026)
von: Apanasevich, I., et al.
Veröffentlicht: (2026)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2026)
von: Xu, Xiaoxu, et al.
Veröffentlicht: (2026)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
von: Xu, Zonghuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
von: Wei, Yifei, et al.
Veröffentlicht: (2026) -
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
von: Wen, Junjie, et al.
Veröffentlicht: (2025) -
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
von: Zhong, Zhide, et al.
Veröffentlicht: (2025) -
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
von: Zhao, Qingqing, et al.
Veröffentlicht: (2025) -
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
von: Bu, Qingwen, et al.
Veröffentlicht: (2025)