VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Jianke, Chen, Xiaoyu, Wang, Qiuyue, Li, Mingsheng, Guo, Yanjiang, Hu, Yucheng, Zhang, Jiajun, Bai, Shuai, Lin, Junyang, Chen, Jianyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improving Vision-Language-Action Model with Online Reinforcement Learning
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025)
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
von: Hu, Yucheng, et al.
Veröffentlicht: (2026)
von: Hu, Yucheng, et al.
Veröffentlicht: (2026)
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
von: Zhang, Jianke, et al.
Veröffentlicht: (2026)
Revisiting Multimodal Positional Encoding in Vision-Language Models
von: Huang, Jie, et al.
Veröffentlicht: (2025)
von: Huang, Jie, et al.
Veröffentlicht: (2025)
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
von: Zhang, Jianke, et al.
Veröffentlicht: (2024)
von: Zhang, Jianke, et al.
Veröffentlicht: (2024)
LLaDA-VLA: Vision Language Diffusion Action Models
von: Wen, Yuqing, et al.
Veröffentlicht: (2025)
von: Wen, Yuqing, et al.
Veröffentlicht: (2025)
MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models
von: Zhou, Zheyuan, et al.
Veröffentlicht: (2026)
von: Zhou, Zheyuan, et al.
Veröffentlicht: (2026)
Revisiting Prompt Pretraining of Vision-Language Models
von: Chen, Zhenyuan, et al.
Veröffentlicht: (2024)
von: Chen, Zhenyuan, et al.
Veröffentlicht: (2024)
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
von: Zhai, Jiajun, et al.
Veröffentlicht: (2026)
von: Zhai, Jiajun, et al.
Veröffentlicht: (2026)
Prediction with Action: Visual Policy Learning via Joint Denoising Process
von: Guo, Yanjiang, et al.
Veröffentlicht: (2024)
von: Guo, Yanjiang, et al.
Veröffentlicht: (2024)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
von: Li, Anqi, et al.
Veröffentlicht: (2025)
von: Li, Anqi, et al.
Veröffentlicht: (2025)
EvoVLA: Self-Evolving Vision-Language-Action Model
von: Liu, Zeting, et al.
Veröffentlicht: (2025)
von: Liu, Zeting, et al.
Veröffentlicht: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
von: Ding, Pengxiang, et al.
Veröffentlicht: (2023)
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
von: Bai, Zechen, et al.
Veröffentlicht: (2025)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
von: Hu, Xintong, et al.
Veröffentlicht: (2026)
von: Hu, Xintong, et al.
Veröffentlicht: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
von: Zhang, Borong, et al.
Veröffentlicht: (2025)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
von: Chen, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Chen, Xiaoyu, et al.
Veröffentlicht: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
von: Jiang, Feng, et al.
Veröffentlicht: (2025)
von: Jiang, Feng, et al.
Veröffentlicht: (2025)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
von: Ye, Angen, et al.
Veröffentlicht: (2025)
von: Ye, Angen, et al.
Veröffentlicht: (2025)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
von: Hu, Yucheng, et al.
Veröffentlicht: (2024)
von: Hu, Yucheng, et al.
Veröffentlicht: (2024)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
von: Liu, Jiaming, et al.
Veröffentlicht: (2025)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
von: Shao, Rui, et al.
Veröffentlicht: (2025)
von: Shao, Rui, et al.
Veröffentlicht: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
von: Li, Hao, et al.
Veröffentlicht: (2025)
von: Li, Hao, et al.
Veröffentlicht: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
von: Li, Yixuan, et al.
Veröffentlicht: (2025)
von: Li, Yixuan, et al.
Veröffentlicht: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
von: Yang, Yantai, et al.
Veröffentlicht: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
von: Li, Qiwei, et al.
Veröffentlicht: (2026)
von: Li, Qiwei, et al.
Veröffentlicht: (2026)
QuoVLA: Quotient Space for Vision-Language-Action Models
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
von: Wang, Xuan, et al.
Veröffentlicht: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
von: Wen, Junjie, et al.
Veröffentlicht: (2025)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
von: Shi, Yiran, et al.
Veröffentlicht: (2026)
von: Shi, Yiran, et al.
Veröffentlicht: (2026)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
von: Zhang, Dapeng, et al.
Veröffentlicht: (2025)
von: Zhang, Dapeng, et al.
Veröffentlicht: (2025)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
von: Xie, Haozhe, et al.
Veröffentlicht: (2026)
von: Xie, Haozhe, et al.
Veröffentlicht: (2026)
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
von: Zhang, Jiahui, et al.
Veröffentlicht: (2025)
von: Zhang, Jiahui, et al.
Veröffentlicht: (2025)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
von: Wang, Xin, et al.
Veröffentlicht: (2025)
von: Wang, Xin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Improving Vision-Language-Action Model with Online Reinforcement Learning
von: Guo, Yanjiang, et al.
Veröffentlicht: (2025) -
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
von: Zhang, Jianke, et al.
Veröffentlicht: (2025) -
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
von: Hu, Yucheng, et al.
Veröffentlicht: (2026) -
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
von: Zhang, Jianke, et al.
Veröffentlicht: (2026) -
Revisiting Multimodal Positional Encoding in Vision-Language Models
von: Huang, Jie, et al.
Veröffentlicht: (2025)