PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Huang, Wenlong, Chao, Yu-Wei, Mousavian, Arsalan, Liu, Ming-Yu, Fox, Dieter, Mo, Kaichun, Fei-Fei, Li
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866912806834536448
author Huang, Wenlong
Chao, Yu-Wei
Mousavian, Arsalan
Liu, Ming-Yu
Fox, Dieter
Mo, Kaichun
Fei-Fei, Li
author_facet Huang, Wenlong
Chao, Yu-Wei
Mousavian, Arsalan
Liu, Ming-Yu
Fox, Dieter
Mo, Kaichun
Fei-Fei, Li
contents Humans anticipate, from a glance and a contemplated action of their bodies, how the 3D world will respond, a capability that is equally vital for robotic manipulation. We introduce PointWorld, a large pre-trained 3D world model that unifies state and action in a shared 3D space as 3D point flows: given one or few RGB-D images and a sequence of low-level robot action commands, PointWorld forecasts per-pixel displacements in 3D that respond to the given actions. By representing actions as 3D point flows instead of embodiment-specific action spaces (e.g., joint positions), this formulation directly conditions on physical geometries of robots while seamlessly integrating learning across embodiments. To train our 3D world model, we curate a large-scale dataset spanning real and simulated robotic manipulation in open-world environments, enabled by recent advances in 3D vision and simulated environments, totaling about 2M trajectories and 500 hours across a single-arm Franka and a bimanual humanoid. Through rigorous, large-scale empirical studies of backbones, action representations, learning objectives, partial observability, data mixtures, domain transfers, and scaling, we distill design principles for large-scale 3D world modeling. With a real-time (0.1s) inference speed, PointWorld can be efficiently integrated in the model-predictive control (MPC) framework for manipulation. We demonstrate that a single pre-trained checkpoint enables a real-world Franka robot to perform rigid-body pushing, deformable and articulated object manipulation, and tool use, without requiring any demonstrations or post-training and all from a single image captured in-the-wild. Project website at https://point-world.github.io/.
format Preprint
id arxiv_https___arxiv_org_abs_2601_03782
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
Huang, Wenlong
Chao, Yu-Wei
Mousavian, Arsalan
Liu, Ming-Yu
Fox, Dieter
Mo, Kaichun
Fei-Fei, Li
Robotics
Artificial Intelligence
Computer Vision and Pattern Recognition
Humans anticipate, from a glance and a contemplated action of their bodies, how the 3D world will respond, a capability that is equally vital for robotic manipulation. We introduce PointWorld, a large pre-trained 3D world model that unifies state and action in a shared 3D space as 3D point flows: given one or few RGB-D images and a sequence of low-level robot action commands, PointWorld forecasts per-pixel displacements in 3D that respond to the given actions. By representing actions as 3D point flows instead of embodiment-specific action spaces (e.g., joint positions), this formulation directly conditions on physical geometries of robots while seamlessly integrating learning across embodiments. To train our 3D world model, we curate a large-scale dataset spanning real and simulated robotic manipulation in open-world environments, enabled by recent advances in 3D vision and simulated environments, totaling about 2M trajectories and 500 hours across a single-arm Franka and a bimanual humanoid. Through rigorous, large-scale empirical studies of backbones, action representations, learning objectives, partial observability, data mixtures, domain transfers, and scaling, we distill design principles for large-scale 3D world modeling. With a real-time (0.1s) inference speed, PointWorld can be efficiently integrated in the model-predictive control (MPC) framework for manipulation. We demonstrate that a single pre-trained checkpoint enables a real-world Franka robot to perform rigid-body pushing, deformable and articulated object manipulation, and tool use, without requiring any demonstrations or post-training and all from a single image captured in-the-wild. Project website at https://point-world.github.io/.
title PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation
topic Robotics
Artificial Intelligence
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2601.03782