ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Caramia, Donato, Pokorny, Florian T., Triggiani, Giuseppe, Ruffino, Denis, Naso, David, Massenio, Paolo Roberto
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909973077819392
author Caramia, Donato
Pokorny, Florian T.
Triggiani, Giuseppe
Ruffino, Denis
Naso, David
Massenio, Paolo Roberto
author_facet Caramia, Donato
Pokorny, Florian T.
Triggiani, Giuseppe
Ruffino, Denis
Naso, David
Massenio, Paolo Roberto
contents Occlusions in robotic bin picking compromise accurate and reliable grasp planning. We present ViTA-Seg, a class-agnostic Vision Transformer framework for real-time amodal segmentation that leverages global attention to recover complete object masks, including hidden regions. We proposte two architectures: a) Single-Head for amodal mask prediction; b) Dual-Head for amodal and occluded mask prediction. We also introduce ViTA-SimData, a photo-realistic synthetic dataset tailored to industrial bin-picking scenario. Extensive experiments on two amodal benchmarks, COOCA and KINS, demonstrate that ViTA-Seg Dual Head achieves strong amodal and occlusion segmentation accuracy with computational efficiency, enabling robust, real-time robotic manipulation.
format Preprint
id arxiv_https___arxiv_org_abs_2512_09510
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics
Caramia, Donato
Pokorny, Florian T.
Triggiani, Giuseppe
Ruffino, Denis
Naso, David
Massenio, Paolo Roberto
Robotics
Computer Vision and Pattern Recognition
Occlusions in robotic bin picking compromise accurate and reliable grasp planning. We present ViTA-Seg, a class-agnostic Vision Transformer framework for real-time amodal segmentation that leverages global attention to recover complete object masks, including hidden regions. We proposte two architectures: a) Single-Head for amodal mask prediction; b) Dual-Head for amodal and occluded mask prediction. We also introduce ViTA-SimData, a photo-realistic synthetic dataset tailored to industrial bin-picking scenario. Extensive experiments on two amodal benchmarks, COOCA and KINS, demonstrate that ViTA-Seg Dual Head achieves strong amodal and occlusion segmentation accuracy with computational efficiency, enabling robust, real-time robotic manipulation.
title ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics
topic Robotics
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2512.09510