Dynamic Execution Commitment of Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Feng, Wang, Xianghui, Chen, Yuxuan, Li, Boying, He, Yefei, Zhang, Zeyu, Wu, Yicheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
par: Fang, Irving, et autres
Publié: (2025)
par: Fang, Irving, et autres
Publié: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
par: Duan, Zicheng, et autres
Publié: (2026)
par: Duan, Zicheng, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)
par: Liu, Zeting, et autres
Publié: (2025)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
par: Ye, Angen, et autres
Publié: (2025)
par: Ye, Angen, et autres
Publié: (2025)
Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models
par: Cai, Zhejia, et autres
Publié: (2025)
par: Cai, Zhejia, et autres
Publié: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026)
par: Zhou, Junkang, et autres
Publié: (2026)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
par: Luo, Yulin, et autres
Publié: (2026)
par: Luo, Yulin, et autres
Publié: (2026)
Less Detail, Better Answers: Degradation-Driven Prompting for VQA
par: Han, Haoxuan, et autres
Publié: (2026)
par: Han, Haoxuan, et autres
Publié: (2026)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
par: Xie, Haozhe, et autres
Publié: (2026)
par: Xie, Haozhe, et autres
Publié: (2026)
Advancing Cross-domain Discriminability in Continual Learning of Vision-Language Models
par: Xu, Yicheng, et autres
Publié: (2024)
par: Xu, Yicheng, et autres
Publié: (2024)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
par: Yang, Ganlin, et autres
Publié: (2025)
par: Yang, Ganlin, et autres
Publié: (2025)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
par: Zhao, Ruiteng, et autres
Publié: (2026)
par: Zhao, Ruiteng, et autres
Publié: (2026)
PlanarGS: High-Fidelity Indoor 3D Gaussian Splatting Guided by Vision-Language Planar Priors
par: Jin, Xirui, et autres
Publié: (2025)
par: Jin, Xirui, et autres
Publié: (2025)
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
par: He, Guangzhao, et autres
Publié: (2026)
par: He, Guangzhao, et autres
Publié: (2026)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
par: Cheng, Jintao, et autres
Publié: (2026)
par: Cheng, Jintao, et autres
Publié: (2026)
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
par: Zhang, Yiwei, et autres
Publié: (2026)
par: Zhang, Yiwei, et autres
Publié: (2026)
QuoVLA: Quotient Space for Vision-Language-Action Models
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
par: Li, Chenxuan, et autres
Publié: (2024)
par: Li, Chenxuan, et autres
Publié: (2024)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
par: Yang, Jiabing, et autres
Publié: (2026)
par: Yang, Jiabing, et autres
Publié: (2026)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
par: Chen, Jiahe, et autres
Publié: (2025)
par: Chen, Jiahe, et autres
Publié: (2025)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
Predicate Debiasing in Vision-Language Models Integration for Scene Graph Generation Enhancement
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking
par: Feng, X., et autres
Publié: (2025)
par: Feng, X., et autres
Publié: (2025)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
Documents similaires
-
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
par: Fang, Irving, et autres
Publié: (2025) -
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024) -
LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
par: Duan, Zicheng, et autres
Publié: (2026) -
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025) -
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)