UMI-3D: Extending Universal Manipulation Interface from Vision-Limited to 3D Spatial Perception
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wang, Ziming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FastUMI-100K: Advancing Data-driven Robotic Manipulation with a Large-scale UMI-style Dataset
par: Liu, Kehui, et autres
Publié: (2025)
par: Liu, Kehui, et autres
Publié: (2025)
UMI-Underwater: Learning Underwater Manipulation without Underwater Teleoperation
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
MV-UMI: A Scalable Multi-View Interface for Cross-Embodiment Learning
par: Rayyan, Omar, et autres
Publié: (2025)
par: Rayyan, Omar, et autres
Publié: (2025)
No Need for Real 3D: Fusing 2D Vision with Pseudo 3D Representations for Robotic Manipulation Learning
par: Yu, Run, et autres
Publié: (2025)
par: Yu, Run, et autres
Publié: (2025)
EL3DD: Extended Latent 3D Diffusion for Language Conditioned Multitask Manipulation
par: Bode, Jonas, et autres
Publié: (2025)
par: Bode, Jonas, et autres
Publié: (2025)
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
par: Li, Peiyan, et autres
Publié: (2025)
par: Li, Peiyan, et autres
Publié: (2025)
FP3: A 3D Foundation Policy for Robotic Manipulation
par: Yang, Rujia, et autres
Publié: (2025)
par: Yang, Rujia, et autres
Publié: (2025)
Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation
par: Li, Yuelei, et autres
Publié: (2025)
par: Li, Yuelei, et autres
Publié: (2025)
DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation
par: Xu, Mengda, et autres
Publié: (2025)
par: Xu, Mengda, et autres
Publié: (2025)
Dynamic Manipulation of Deformable Objects in 3D: Simulation, Benchmark and Learning Strategy
par: Lan, Guanzhou, et autres
Publié: (2025)
par: Lan, Guanzhou, et autres
Publié: (2025)
GP3: A 3D Geometry-Aware Policy with Multi-View Images for Robotic Manipulation
par: Qian, Quanhao, et autres
Publié: (2025)
par: Qian, Quanhao, et autres
Publié: (2025)
A3D: Adaptive Affordance Assembly with Dual-Arm Manipulation
par: Liang, Jiaqi, et autres
Publié: (2026)
par: Liang, Jiaqi, et autres
Publié: (2026)
FastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface with Dataset
par: Zhaxizhuoma, et autres
Publié: (2024)
par: Zhaxizhuoma, et autres
Publié: (2024)
AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation
par: Zhao, Ziyan, et autres
Publié: (2025)
par: Zhao, Ziyan, et autres
Publié: (2025)
ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation
par: Lu, Guanxing, et autres
Publié: (2024)
par: Lu, Guanxing, et autres
Publié: (2024)
Manipulating Elasto-Plastic Objects With 3D Occupancy and Learning-Based Predictive Control
par: Zhang, Zhen, et autres
Publié: (2025)
par: Zhang, Zhen, et autres
Publié: (2025)
EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation
par: Dong, Zibin, et autres
Publié: (2025)
par: Dong, Zibin, et autres
Publié: (2025)
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
par: Xu, Tianling, et autres
Publié: (2025)
par: Xu, Tianling, et autres
Publié: (2025)
DyWA: Dynamics-adaptive World Action Model for Generalizable Non-prehensile Manipulation
par: Lyu, Jiangran, et autres
Publié: (2025)
par: Lyu, Jiangran, et autres
Publié: (2025)
Flow as the Cross-Domain Manipulation Interface
par: Xu, Mengda, et autres
Publié: (2024)
par: Xu, Mengda, et autres
Publié: (2024)
MRHER: Model-based Relay Hindsight Experience Replay for Sequential Object Manipulation Tasks with Sparse Rewards
par: Huang, Yuming, et autres
Publié: (2023)
par: Huang, Yuming, et autres
Publié: (2023)
Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
par: Malik, Ashish, et autres
Publié: (2026)
par: Malik, Ashish, et autres
Publié: (2026)
RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics
par: Song, Chan Hee, et autres
Publié: (2024)
par: Song, Chan Hee, et autres
Publié: (2024)
3D-ViTac: Learning Fine-Grained Manipulation with Visuo-Tactile Sensing
par: Huang, Binghao, et autres
Publié: (2024)
par: Huang, Binghao, et autres
Publié: (2024)
Indoor and Outdoor 3D Scene Graph Generation via Language-Enabled Spatial Ontologies
par: Strader, Jared, et autres
Publié: (2023)
par: Strader, Jared, et autres
Publié: (2023)
Active-Perceptive Motion Generation for Mobile Manipulation
par: Jauhri, Snehal, et autres
Publié: (2023)
par: Jauhri, Snehal, et autres
Publié: (2023)
TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks
par: Cheng, Tailai, et autres
Publié: (2026)
par: Cheng, Tailai, et autres
Publié: (2026)
DeformerNet: Learning Bimanual Manipulation of 3D Deformable Objects
par: Thach, Bao, et autres
Publié: (2023)
par: Thach, Bao, et autres
Publié: (2023)
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
par: Liu, Ruixun, et autres
Publié: (2025)
par: Liu, Ruixun, et autres
Publié: (2025)
3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting
par: Zheng, Wancai, et autres
Publié: (2026)
par: Zheng, Wancai, et autres
Publié: (2026)
RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization
par: Liu, Songming, et autres
Publié: (2026)
par: Liu, Songming, et autres
Publié: (2026)
Unifying 2D and 3D Vision-Language Understanding
par: Jain, Ayush, et autres
Publié: (2025)
par: Jain, Ayush, et autres
Publié: (2025)
FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects
par: Eisner, Ben, et autres
Publié: (2022)
par: Eisner, Ben, et autres
Publié: (2022)
ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory
par: Li, Ying, et autres
Publié: (2025)
par: Li, Ying, et autres
Publié: (2025)
3DSGrasp: 3D Shape-Completion for Robotic Grasp
par: Mohammadi, Seyed S., et autres
Publié: (2023)
par: Mohammadi, Seyed S., et autres
Publié: (2023)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
par: Fan, Qingyu, et autres
Publié: (2026)
par: Fan, Qingyu, et autres
Publié: (2026)
3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning
par: Tang, Guoqin, et autres
Publié: (2025)
par: Tang, Guoqin, et autres
Publié: (2025)
CL3R: 3D Reconstruction and Contrastive Learning for Enhanced Robotic Manipulation Representations
par: Cui, Wenbo, et autres
Publié: (2025)
par: Cui, Wenbo, et autres
Publié: (2025)
Point2Graph: An End-to-end Point Cloud-based 3D Open-Vocabulary Scene Graph for Robot Navigation
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
par: Pei, Xiaohuan, et autres
Publié: (2025)
par: Pei, Xiaohuan, et autres
Publié: (2025)
Documents similaires
-
FastUMI-100K: Advancing Data-driven Robotic Manipulation with a Large-scale UMI-style Dataset
par: Liu, Kehui, et autres
Publié: (2025) -
UMI-Underwater: Learning Underwater Manipulation without Underwater Teleoperation
par: Li, Hao, et autres
Publié: (2026) -
MV-UMI: A Scalable Multi-View Interface for Cross-Embodiment Learning
par: Rayyan, Omar, et autres
Publié: (2025) -
No Need for Real 3D: Fusing 2D Vision with Pseudo 3D Representations for Robotic Manipulation Learning
par: Yu, Run, et autres
Publié: (2025) -
EL3DD: Extended Latent 3D Diffusion for Language Conditioned Multitask Manipulation
par: Bode, Jonas, et autres
Publié: (2025)