VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Rokuss, Maximilian, Langenberg, Moritz, Kirchhoff, Yannick, Isensee, Fabian, Hamm, Benjamin, Ulrich, Constantin, Regnery, Sebastian, Bauer, Lukas, Katsigiannopulos, Efthimios, Norajitra, Tobias, Maier-Hein, Klaus
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866911266095759360
author Rokuss, Maximilian
Langenberg, Moritz
Kirchhoff, Yannick
Isensee, Fabian
Hamm, Benjamin
Ulrich, Constantin
Regnery, Sebastian
Bauer, Lukas
Katsigiannopulos, Efthimios
Norajitra, Tobias
Maier-Hein, Klaus
author_facet Rokuss, Maximilian
Langenberg, Moritz
Kirchhoff, Yannick
Isensee, Fabian
Hamm, Benjamin
Ulrich, Constantin
Regnery, Sebastian
Bauer, Lukas
Katsigiannopulos, Efthimios
Norajitra, Tobias
Maier-Hein, Klaus
contents We introduce VoxTell, a vision-language model for text-prompted volumetric medical image segmentation. It maps free-form descriptions, from single words to full clinical sentences, to 3D masks. Trained on 62K+ CT, MRI, and PET volumes spanning over 1K anatomical and pathological classes, VoxTell uses multi-stage vision-language fusion across decoder layers to align textual and visual features at multiple scales. It achieves state-of-the-art zero-shot performance across modalities on unseen datasets, excelling on familiar concepts while generalizing to related unseen classes. Extensive experiments further demonstrate strong cross-modality transfer, robustness to linguistic variations and clinical language, as well as accurate instance-specific segmentation from real-world text. Code is available at: https://www.github.com/MIC-DKFZ/VoxTell
format Preprint
id arxiv_https___arxiv_org_abs_2511_11450
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
Rokuss, Maximilian
Langenberg, Moritz
Kirchhoff, Yannick
Isensee, Fabian
Hamm, Benjamin
Ulrich, Constantin
Regnery, Sebastian
Bauer, Lukas
Katsigiannopulos, Efthimios
Norajitra, Tobias
Maier-Hein, Klaus
Computer Vision and Pattern Recognition
Machine Learning
We introduce VoxTell, a vision-language model for text-prompted volumetric medical image segmentation. It maps free-form descriptions, from single words to full clinical sentences, to 3D masks. Trained on 62K+ CT, MRI, and PET volumes spanning over 1K anatomical and pathological classes, VoxTell uses multi-stage vision-language fusion across decoder layers to align textual and visual features at multiple scales. It achieves state-of-the-art zero-shot performance across modalities on unseen datasets, excelling on familiar concepts while generalizing to related unseen classes. Extensive experiments further demonstrate strong cross-modality transfer, robustness to linguistic variations and clinical language, as well as accurate instance-specific segmentation from real-world text. Code is available at: https://www.github.com/MIC-DKFZ/VoxTell
title VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
topic Computer Vision and Pattern Recognition
Machine Learning
url https://arxiv.org/abs/2511.11450