ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Jin, Zhao, Che, Zhengping, Li, Tao, Zhao, Zhen, Wu, Kun, Zhang, Yuheng, Zhao, Yinuo, Liu, Zehui, Zhang, Qiang, Ju, Xiaozhu, Tian, Jing, Xue, Yousong, Tang, Jian
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866918354757877760
author Jin, Zhao
Che, Zhengping
Li, Tao
Zhao, Zhen
Wu, Kun
Zhang, Yuheng
Zhao, Yinuo
Liu, Zehui
Zhang, Qiang
Ju, Xiaozhu
Tian, Jing
Xue, Yousong
Tang, Jian
author_facet Jin, Zhao
Che, Zhengping
Li, Tao
Zhao, Zhen
Wu, Kun
Zhang, Yuheng
Zhao, Yinuo
Liu, Zehui
Zhang, Qiang
Ju, Xiaozhu
Tian, Jing
Xue, Yousong
Tang, Jian
contents Robot learning increasingly relies on simulation to advance complex ability such as dexterous manipulations and precise interactions, necessitating high-quality digital assets to bridge the sim-to-real gap. However, existing open-source articulated-object datasets for simulation are limited by insufficient visual realism and low physical fidelity, which hinder their utility for training models mastering robotic tasks in real world. To address these challenges, we introduce ArtVIP, a comprehensive open-source dataset comprising high-quality digital-twin articulated objects, accompanied by indoor-scene assets. Crafted by professional 3D modelers adhering to unified standards, ArtVIP ensures visual realism through precise geometric meshes and high-resolution textures, while physical fidelity is achieved via fine-tuned dynamic parameters. Meanwhile, the dataset pioneers embedded modular interaction behaviors within assets and pixel-level affordance annotations. Feature-map visualization and optical motion capture are employed to quantitatively demonstrate ArtVIP's visual and physical fidelity, with its applicability validated across imitation learning and reinforcement learning experiments. Provided in USD format with detailed production guidelines, ArtVIP is fully open-source, benefiting the research community and advancing robot learning research. Our project is at https://x-humanoid-artvip.github.io/ .
format Preprint
id arxiv_https___arxiv_org_abs_2506_04941
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning
Jin, Zhao
Che, Zhengping
Li, Tao
Zhao, Zhen
Wu, Kun
Zhang, Yuheng
Zhao, Yinuo
Liu, Zehui
Zhang, Qiang
Ju, Xiaozhu
Tian, Jing
Xue, Yousong
Tang, Jian
Robotics
Robot learning increasingly relies on simulation to advance complex ability such as dexterous manipulations and precise interactions, necessitating high-quality digital assets to bridge the sim-to-real gap. However, existing open-source articulated-object datasets for simulation are limited by insufficient visual realism and low physical fidelity, which hinder their utility for training models mastering robotic tasks in real world. To address these challenges, we introduce ArtVIP, a comprehensive open-source dataset comprising high-quality digital-twin articulated objects, accompanied by indoor-scene assets. Crafted by professional 3D modelers adhering to unified standards, ArtVIP ensures visual realism through precise geometric meshes and high-resolution textures, while physical fidelity is achieved via fine-tuned dynamic parameters. Meanwhile, the dataset pioneers embedded modular interaction behaviors within assets and pixel-level affordance annotations. Feature-map visualization and optical motion capture are employed to quantitatively demonstrate ArtVIP's visual and physical fidelity, with its applicability validated across imitation learning and reinforcement learning experiments. Provided in USD format with detailed production guidelines, ArtVIP is fully open-source, benefiting the research community and advancing robot learning research. Our project is at https://x-humanoid-artvip.github.io/ .
title ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning
topic Robotics
url https://arxiv.org/abs/2506.04941