VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | , , , , , , , , , , |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
| _version_ | 1866911266095759360 |
|---|---|
| author | Rokuss, Maximilian Langenberg, Moritz Kirchhoff, Yannick Isensee, Fabian Hamm, Benjamin Ulrich, Constantin Regnery, Sebastian Bauer, Lukas Katsigiannopulos, Efthimios Norajitra, Tobias Maier-Hein, Klaus |
| author_facet | Rokuss, Maximilian Langenberg, Moritz Kirchhoff, Yannick Isensee, Fabian Hamm, Benjamin Ulrich, Constantin Regnery, Sebastian Bauer, Lukas Katsigiannopulos, Efthimios Norajitra, Tobias Maier-Hein, Klaus |
| contents | We introduce VoxTell, a vision-language model for text-prompted volumetric medical image segmentation. It maps free-form descriptions, from single words to full clinical sentences, to 3D masks. Trained on 62K+ CT, MRI, and PET volumes spanning over 1K anatomical and pathological classes, VoxTell uses multi-stage vision-language fusion across decoder layers to align textual and visual features at multiple scales. It achieves state-of-the-art zero-shot performance across modalities on unseen datasets, excelling on familiar concepts while generalizing to related unseen classes. Extensive experiments further demonstrate strong cross-modality transfer, robustness to linguistic variations and clinical language, as well as accurate instance-specific segmentation from real-world text. Code is available at: https://www.github.com/MIC-DKFZ/VoxTell |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2511_11450 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation Rokuss, Maximilian Langenberg, Moritz Kirchhoff, Yannick Isensee, Fabian Hamm, Benjamin Ulrich, Constantin Regnery, Sebastian Bauer, Lukas Katsigiannopulos, Efthimios Norajitra, Tobias Maier-Hein, Klaus Computer Vision and Pattern Recognition Machine Learning We introduce VoxTell, a vision-language model for text-prompted volumetric medical image segmentation. It maps free-form descriptions, from single words to full clinical sentences, to 3D masks. Trained on 62K+ CT, MRI, and PET volumes spanning over 1K anatomical and pathological classes, VoxTell uses multi-stage vision-language fusion across decoder layers to align textual and visual features at multiple scales. It achieves state-of-the-art zero-shot performance across modalities on unseen datasets, excelling on familiar concepts while generalizing to related unseen classes. Extensive experiments further demonstrate strong cross-modality transfer, robustness to linguistic variations and clinical language, as well as accurate instance-specific segmentation from real-world text. Code is available at: https://www.github.com/MIC-DKFZ/VoxTell |
| title | VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation |
| topic | Computer Vision and Pattern Recognition Machine Learning |
| url | https://arxiv.org/abs/2511.11450 |