ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yan, Ge, Zhu, Jiyue, Deng, Yuquan, Yang, Shiqi, Qiu, Ri-Zhao, Cheng, Xuxin, Memmel, Marius, Krishna, Ranjay, Goyal, Ankit, Wang, Xiaolong, Fox, Dieter
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914017120878592
author Yan, Ge
Zhu, Jiyue
Deng, Yuquan
Yang, Shiqi
Qiu, Ri-Zhao
Cheng, Xuxin
Memmel, Marius
Krishna, Ranjay
Goyal, Ankit
Wang, Xiaolong
Fox, Dieter
author_facet Yan, Ge
Zhu, Jiyue
Deng, Yuquan
Yang, Shiqi
Qiu, Ri-Zhao
Cheng, Xuxin
Memmel, Marius
Krishna, Ranjay
Goyal, Ankit
Wang, Xiaolong
Fox, Dieter
contents This paper introduces ManiFlow, a visuomotor imitation learning policy for general robot manipulation that generates precise, high-dimensional actions conditioned on diverse visual, language and proprioceptive inputs. We leverage flow matching with consistency training to enable high-quality dexterous action generation in just 1-2 inference steps. To handle diverse input modalities efficiently, we propose DiT-X, a diffusion transformer architecture with adaptive cross-attention and AdaLN-Zero conditioning that enables fine-grained feature interactions between action tokens and multi-modal observations. ManiFlow demonstrates consistent improvements across diverse simulation benchmarks and nearly doubles success rates on real-world tasks across single-arm, bimanual, and humanoid robot setups with increasing dexterity. The extensive evaluation further demonstrates the strong robustness and generalizability of ManiFlow to novel objects and background changes, and highlights its strong scaling capability with larger-scale datasets. Our website: maniflow-policy.github.io.
format Preprint
id arxiv_https___arxiv_org_abs_2509_01819
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
Yan, Ge
Zhu, Jiyue
Deng, Yuquan
Yang, Shiqi
Qiu, Ri-Zhao
Cheng, Xuxin
Memmel, Marius
Krishna, Ranjay
Goyal, Ankit
Wang, Xiaolong
Fox, Dieter
Robotics
This paper introduces ManiFlow, a visuomotor imitation learning policy for general robot manipulation that generates precise, high-dimensional actions conditioned on diverse visual, language and proprioceptive inputs. We leverage flow matching with consistency training to enable high-quality dexterous action generation in just 1-2 inference steps. To handle diverse input modalities efficiently, we propose DiT-X, a diffusion transformer architecture with adaptive cross-attention and AdaLN-Zero conditioning that enables fine-grained feature interactions between action tokens and multi-modal observations. ManiFlow demonstrates consistent improvements across diverse simulation benchmarks and nearly doubles success rates on real-world tasks across single-arm, bimanual, and humanoid robot setups with increasing dexterity. The extensive evaluation further demonstrates the strong robustness and generalizability of ManiFlow to novel objects and background changes, and highlights its strong scaling capability with larger-scale datasets. Our website: maniflow-policy.github.io.
title ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
topic Robotics
url https://arxiv.org/abs/2509.01819