WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Fangqi, Yan, Zhengyang, Hong, Zicong, Shou, Quanxin, Ma, Xiao, Guo, Song |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
par: Shou, Quanxin, et autres
Publié: (2026)
par: Shou, Quanxin, et autres
Publié: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026)
par: Liufu, Weijia, et autres
Publié: (2026)
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
par: Yang, Rushuai, et autres
Publié: (2026)
par: Yang, Rushuai, et autres
Publié: (2026)
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
par: Hung, Chia-Yu, et autres
Publié: (2025)
par: Hung, Chia-Yu, et autres
Publié: (2025)
IRASim: A Fine-Grained World Model for Robot Manipulation
par: Zhu, Fangqi, et autres
Publié: (2024)
par: Zhu, Fangqi, et autres
Publié: (2024)
LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
par: Hong, Youngjin, et autres
Publié: (2025)
par: Hong, Youngjin, et autres
Publié: (2025)
TGRPO :Fine-tuning Vision-Language-Action Model via Trajectory-wise Group Relative Policy Optimization
par: Chen, Zengjue, et autres
Publié: (2025)
par: Chen, Zengjue, et autres
Publié: (2025)
Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search
par: Neary, Cyrus, et autres
Publié: (2025)
par: Neary, Cyrus, et autres
Publié: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
par: Jiang, Anqing, et autres
Publié: (2025)
par: Jiang, Anqing, et autres
Publié: (2025)
Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
par: Li, Shunlei, et autres
Publié: (2025)
par: Li, Shunlei, et autres
Publié: (2025)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
par: Li, Jiashun, et autres
Publié: (2026)
par: Li, Jiashun, et autres
Publié: (2026)
LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation
par: Wang, Zhijie, et autres
Publié: (2024)
par: Wang, Zhijie, et autres
Publié: (2024)
Action Hallucination in Generative Vision-Language-Action Models
par: Soh, Harold, et autres
Publié: (2026)
par: Soh, Harold, et autres
Publié: (2026)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
par: Zhai, Shaopeng, et autres
Publié: (2025)
par: Zhai, Shaopeng, et autres
Publié: (2025)
WorldVLA: Towards Autoregressive Action World Model
par: Cen, Jun, et autres
Publié: (2025)
par: Cen, Jun, et autres
Publié: (2025)
Mean-Flow based One-Step Vision-Language-Action
par: Chen, Yang, et autres
Publié: (2026)
par: Chen, Yang, et autres
Publié: (2026)
Human-assisted Robotic Policy Refinement via Action Preference Optimization
par: Xia, Wenke, et autres
Publié: (2025)
par: Xia, Wenke, et autres
Publié: (2025)
Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations
par: Liu, Hanqing, et autres
Publié: (2025)
par: Liu, Hanqing, et autres
Publié: (2025)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
par: Jin, Xinchen, et autres
Publié: (2026)
par: Jin, Xinchen, et autres
Publié: (2026)
Adversarial Attacks on Robotic Vision Language Action Models
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
par: Jones, Eliot Krzysztof, et autres
Publié: (2025)
Survey of Vision-Language-Action Models for Embodied Manipulation
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
par: Zou, Teqiang, et autres
Publié: (2025)
par: Zou, Teqiang, et autres
Publié: (2025)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
par: Dai, Yuntao, et autres
Publié: (2025)
par: Dai, Yuntao, et autres
Publié: (2025)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
par: Hu, Yutong, et autres
Publié: (2026)
par: Hu, Yutong, et autres
Publié: (2026)
DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
par: Su, Taiyi, et autres
Publié: (2026)
par: Su, Taiyi, et autres
Publié: (2026)
MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models
par: Zhao, Han, et autres
Publié: (2025)
par: Zhao, Han, et autres
Publié: (2025)
Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture
par: Lu, Hong, et autres
Publié: (2025)
par: Lu, Hong, et autres
Publié: (2025)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
par: Xu, Zonghuan, et autres
Publié: (2025)
par: Xu, Zonghuan, et autres
Publié: (2025)
World-aware Planning Narratives Enhance Large Vision-Language Model Planner
par: Shi, Junhao, et autres
Publié: (2025)
par: Shi, Junhao, et autres
Publié: (2025)
Developing Vision-Language-Action Model from Egocentric Videos
par: Yoshida, Tomoya, et autres
Publié: (2025)
par: Yoshida, Tomoya, et autres
Publié: (2025)
Emergence of Human to Robot Transfer in Vision-Language-Action Models
par: Kareer, Simar, et autres
Publié: (2025)
par: Kareer, Simar, et autres
Publié: (2025)
SAFE: Multitask Failure Detection for Vision-Language-Action Models
par: Gu, Qiao, et autres
Publié: (2025)
par: Gu, Qiao, et autres
Publié: (2025)
Continually Evolving Skill Knowledge in Vision Language Action Model
par: Wu, Yuxuan, et autres
Publié: (2025)
par: Wu, Yuxuan, et autres
Publié: (2025)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
par: Wang, Taowen, et autres
Publié: (2024)
par: Wang, Taowen, et autres
Publié: (2024)
Robust Finetuning of Vision-Language-Action Robot Policies via Parameter Merging
par: Yadav, Yajat, et autres
Publié: (2025)
par: Yadav, Yajat, et autres
Publié: (2025)
DKPROMPT: Domain Knowledge Prompting Vision-Language Models for Open-World Planning
par: Zhang, Xiaohan, et autres
Publié: (2024)
par: Zhang, Xiaohan, et autres
Publié: (2024)
Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models
par: Jin, Ruixing, et autres
Publié: (2026)
par: Jin, Ruixing, et autres
Publié: (2026)
Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation
par: Zhang, Yihao, et autres
Publié: (2025)
par: Zhang, Yihao, et autres
Publié: (2025)
Documents similaires
-
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
par: Shou, Quanxin, et autres
Publié: (2026) -
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026) -
ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training
par: Yang, Rushuai, et autres
Publié: (2026) -
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
par: Chen, Yuxuan, et autres
Publié: (2025) -
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
par: Hung, Chia-Yu, et autres
Publié: (2025)