Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhilong, Ren, Haoxiang, Sun, Yihao, Sheng, Yifei, Wang, Haonan, Lin, Haoxin, Wu, Zhichao, Bacon, Pierre-Luc, Yu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation
di: Wu, Zhichao, et al.
Pubblicazione: (2026)
di: Wu, Zhichao, et al.
Pubblicazione: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation
di: Zhang, Yihao, et al.
Pubblicazione: (2025)
di: Zhang, Yihao, et al.
Pubblicazione: (2025)
Planning with Unified Multimodal Models
di: Sun, Yihao, et al.
Pubblicazione: (2025)
di: Sun, Yihao, et al.
Pubblicazione: (2025)
A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
di: Zhai, Shaopeng, et al.
Pubblicazione: (2025)
di: Zhai, Shaopeng, et al.
Pubblicazione: (2025)
WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
di: Zhu, Fangqi, et al.
Pubblicazione: (2025)
di: Zhu, Fangqi, et al.
Pubblicazione: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
di: Li, Hengtao, et al.
Pubblicazione: (2025)
di: Li, Hengtao, et al.
Pubblicazione: (2025)
Toward Embodiment Equivariant Vision-Language-Action Policy
di: Chen, Anzhe, et al.
Pubblicazione: (2025)
di: Chen, Anzhe, et al.
Pubblicazione: (2025)
Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models
di: Lyu, Mingyang, et al.
Pubblicazione: (2025)
di: Lyu, Mingyang, et al.
Pubblicazione: (2025)
Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation
di: Zhang, Zhilong, et al.
Pubblicazione: (2026)
di: Zhang, Zhilong, et al.
Pubblicazione: (2026)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
di: Li, Runze, et al.
Pubblicazione: (2026)
di: Li, Runze, et al.
Pubblicazione: (2026)
Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models
di: Sun, Ming, et al.
Pubblicazione: (2026)
di: Sun, Ming, et al.
Pubblicazione: (2026)
ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller
di: Lin, Haoxin, et al.
Pubblicazione: (2026)
di: Lin, Haoxin, et al.
Pubblicazione: (2026)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
di: Dai, Yuntao, et al.
Pubblicazione: (2025)
di: Dai, Yuntao, et al.
Pubblicazione: (2025)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
di: GigaBrain Team, et al.
Pubblicazione: (2025)
di: GigaBrain Team, et al.
Pubblicazione: (2025)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
di: Hung, Chia-Yu, et al.
Pubblicazione: (2025)
di: Hung, Chia-Yu, et al.
Pubblicazione: (2025)
VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
di: Guo, Yanjiang, et al.
Pubblicazione: (2026)
RynnVLA-002: A Unified Vision-Language-Action and World Model
di: Cen, Jun, et al.
Pubblicazione: (2025)
di: Cen, Jun, et al.
Pubblicazione: (2025)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
di: Fan, Shichao, et al.
Pubblicazione: (2025)
di: Fan, Shichao, et al.
Pubblicazione: (2025)
AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models
di: Hu, Yutong, et al.
Pubblicazione: (2026)
di: Hu, Yutong, et al.
Pubblicazione: (2026)
Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models
di: Liu, Haoyun, et al.
Pubblicazione: (2026)
di: Liu, Haoyun, et al.
Pubblicazione: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving
di: Qu, Yansong, et al.
Pubblicazione: (2025)
di: Qu, Yansong, et al.
Pubblicazione: (2025)
ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models
di: Hu, Yanbin, et al.
Pubblicazione: (2026)
di: Hu, Yanbin, et al.
Pubblicazione: (2026)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
di: Li, Meng, et al.
Pubblicazione: (2025)
di: Li, Meng, et al.
Pubblicazione: (2025)
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
di: Wang, Yihao, et al.
Pubblicazione: (2025)
di: Wang, Yihao, et al.
Pubblicazione: (2025)
SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models
di: Liu, Haowen, et al.
Pubblicazione: (2025)
di: Liu, Haowen, et al.
Pubblicazione: (2025)
Stable Language Guidance for Vision-Language-Action Models
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
di: Zhan, Zhihao, et al.
Pubblicazione: (2026)
WorldVLA: Towards Autoregressive Action World Model
di: Cen, Jun, et al.
Pubblicazione: (2025)
di: Cen, Jun, et al.
Pubblicazione: (2025)
GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
di: Abouzeid, Ali, et al.
Pubblicazione: (2025)
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
di: Dai, Mingtong, et al.
Pubblicazione: (2025)
di: Dai, Mingtong, et al.
Pubblicazione: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
di: jia, Feiyang, et al.
Pubblicazione: (2026)
di: jia, Feiyang, et al.
Pubblicazione: (2026)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
di: Won, John, et al.
Pubblicazione: (2025)
di: Won, John, et al.
Pubblicazione: (2025)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
di: Intelligence, Physical, et al.
Pubblicazione: (2025)
di: Intelligence, Physical, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation
di: Wu, Zhichao, et al.
Pubblicazione: (2026) -
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026) -
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026) -
Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation
di: Zhang, Yihao, et al.
Pubblicazione: (2025) -
Planning with Unified Multimodal Models
di: Sun, Yihao, et al.
Pubblicazione: (2025)