ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics
Fuente:
arXiv
Saved in:
| Main Authors: | , , , , , |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
| _version_ | 1866909973077819392 |
|---|---|
| author | Caramia, Donato Pokorny, Florian T. Triggiani, Giuseppe Ruffino, Denis Naso, David Massenio, Paolo Roberto |
| author_facet | Caramia, Donato Pokorny, Florian T. Triggiani, Giuseppe Ruffino, Denis Naso, David Massenio, Paolo Roberto |
| contents | Occlusions in robotic bin picking compromise accurate and reliable grasp planning. We present ViTA-Seg, a class-agnostic Vision Transformer framework for real-time amodal segmentation that leverages global attention to recover complete object masks, including hidden regions. We proposte two architectures: a) Single-Head for amodal mask prediction; b) Dual-Head for amodal and occluded mask prediction. We also introduce ViTA-SimData, a photo-realistic synthetic dataset tailored to industrial bin-picking scenario. Extensive experiments on two amodal benchmarks, COOCA and KINS, demonstrate that ViTA-Seg Dual Head achieves strong amodal and occlusion segmentation accuracy with computational efficiency, enabling robust, real-time robotic manipulation. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2512_09510 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics Caramia, Donato Pokorny, Florian T. Triggiani, Giuseppe Ruffino, Denis Naso, David Massenio, Paolo Roberto Robotics Computer Vision and Pattern Recognition Occlusions in robotic bin picking compromise accurate and reliable grasp planning. We present ViTA-Seg, a class-agnostic Vision Transformer framework for real-time amodal segmentation that leverages global attention to recover complete object masks, including hidden regions. We proposte two architectures: a) Single-Head for amodal mask prediction; b) Dual-Head for amodal and occluded mask prediction. We also introduce ViTA-SimData, a photo-realistic synthetic dataset tailored to industrial bin-picking scenario. Extensive experiments on two amodal benchmarks, COOCA and KINS, demonstrate that ViTA-Seg Dual Head achieves strong amodal and occlusion segmentation accuracy with computational efficiency, enabling robust, real-time robotic manipulation. |
| title | ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics |
| topic | Robotics Computer Vision and Pattern Recognition |
| url | https://arxiv.org/abs/2512.09510 |