Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Li, Yuyang, Chen, Yinghan, Zhao, Zihang, Li, Puhao, Liu, Tengyu, Huang, Siyuan, Zhu, Yixin
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866910016147030016
author Li, Yuyang
Chen, Yinghan
Zhao, Zihang
Li, Puhao
Liu, Tengyu
Huang, Siyuan
Zhu, Yixin
author_facet Li, Yuyang
Chen, Yinghan
Zhao, Zihang
Li, Puhao
Liu, Tengyu
Huang, Siyuan
Zhu, Yixin
contents Robotic manipulation requires both rich multimodal perception and effective learning frameworks to handle complex real-world tasks. See-through-skin (STS) sensors, which combine tactile and visual perception, offer promising sensing capabilities, while modern imitation learning provides powerful tools for policy acquisition. However, existing STS designs lack simultaneous multimodal perception and suffer from unreliable tactile tracking. Furthermore, integrating these rich multimodal signals into learning-based manipulation pipelines remains an open challenge. We introduce TacThru, an STS sensor enabling simultaneous visual perception and robust tactile signal extraction, and TacThru-UMI, an imitation learning framework that leverages these multimodal signals for manipulation. Our sensor features a fully transparent elastomer, persistent illumination, novel keyline markers, and efficient tracking, while our learning system integrates these signals through a Transformer-based Diffusion Policy. Experiments on five challenging real-world tasks show that TacThru-UMI achieves an average success rate of 85.5%, significantly outperforming the baselines of tactile policy(66.3%) and vision-only policy (55.4%). The system excels in critical scenarios, including contact detection with thin and soft objects and precision manipulation requiring multimodal coordination. This work demonstrates that combining simultaneous multimodal perception with modern learning frameworks enables more precise, adaptable robotic manipulation.
format Preprint
id arxiv_https___arxiv_org_abs_2512_09851
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
Li, Yuyang
Chen, Yinghan
Zhao, Zihang
Li, Puhao
Liu, Tengyu
Huang, Siyuan
Zhu, Yixin
Robotics
Computer Vision and Pattern Recognition
Robotic manipulation requires both rich multimodal perception and effective learning frameworks to handle complex real-world tasks. See-through-skin (STS) sensors, which combine tactile and visual perception, offer promising sensing capabilities, while modern imitation learning provides powerful tools for policy acquisition. However, existing STS designs lack simultaneous multimodal perception and suffer from unreliable tactile tracking. Furthermore, integrating these rich multimodal signals into learning-based manipulation pipelines remains an open challenge. We introduce TacThru, an STS sensor enabling simultaneous visual perception and robust tactile signal extraction, and TacThru-UMI, an imitation learning framework that leverages these multimodal signals for manipulation. Our sensor features a fully transparent elastomer, persistent illumination, novel keyline markers, and efficient tracking, while our learning system integrates these signals through a Transformer-based Diffusion Policy. Experiments on five challenging real-world tasks show that TacThru-UMI achieves an average success rate of 85.5%, significantly outperforming the baselines of tactile policy(66.3%) and vision-only policy (55.4%). The system excels in critical scenarios, including contact detection with thin and soft objects and precision manipulation requiring multimodal coordination. This work demonstrates that combining simultaneous multimodal perception with modern learning frameworks enables more precise, adaptable robotic manipulation.
title Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
topic Robotics
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2512.09851