Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rädsch, Tim, Mayer, Leon, Pavicic, Simon, Kavur, A. Emre, Knopp, Marcel, Öztürk, Barış, Maier-Hein, Klaus, Jaeger, Paul F., Isensee, Fabian, Reinke, Annika, Maier-Hein, Lena |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models
par: Mayer, Leon, et autres
Publié: (2025)
par: Mayer, Leon, et autres
Publié: (2025)
Quality Assured: Rethinking Annotation Strategies in Imaging AI
par: Rädsch, Tim, et autres
Publié: (2024)
par: Rädsch, Tim, et autres
Publié: (2024)
Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study
par: Mayer, Leon, et autres
Publié: (2025)
par: Mayer, Leon, et autres
Publié: (2025)
Revisiting 3D Medical Scribble Supervision: Benchmarking Beyond Cardiac Segmentation
par: Gotkowski, Karol, et autres
Publié: (2024)
par: Gotkowski, Karol, et autres
Publié: (2024)
Advancing standards in biomedical image analysis validation: A perspective on Metrics Reloaded
par: Annika Reinke, et autres
Publié: (2025)
par: Annika Reinke, et autres
Publié: (2025)
FISBe: A real-world benchmark dataset for instance segmentation of long-range thin filamentous structures
par: Mais, Lisa, et autres
Publié: (2024)
par: Mais, Lisa, et autres
Publié: (2024)
Towards Interactive Lesion Segmentation in Whole-Body PET/CT with Promptable Models
par: Rokuss, Maximilian, et autres
Publié: (2025)
par: Rokuss, Maximilian, et autres
Publié: (2025)
Large Scale Supervised Pretraining For Traumatic Brain Injury Segmentation
par: Ulrich, Constantin, et autres
Publié: (2025)
par: Ulrich, Constantin, et autres
Publié: (2025)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
par: Kahl, Kim-Celine, et autres
Publié: (2024)
par: Kahl, Kim-Celine, et autres
Publié: (2024)
Promptable Longitudinal Lesion Segmentation in Whole-Body CT
par: Kirchhoff, Yannick, et autres
Publié: (2025)
par: Kirchhoff, Yannick, et autres
Publié: (2025)
Overcoming Common Flaws in the Evaluation of Selective Classification Systems
par: Traub, Jeremias, et autres
Publié: (2024)
par: Traub, Jeremias, et autres
Publié: (2024)
Beyond Knowledge Silos: Task Fingerprinting for Democratization of Medical Imaging AI
par: Godau, Patrick, et autres
Publié: (2024)
par: Godau, Patrick, et autres
Publié: (2024)
nnU-Net Revisited: A Call for Rigorous Validation in 3D Medical Image Segmentation
par: Isensee, Fabian, et autres
Publié: (2024)
par: Isensee, Fabian, et autres
Publié: (2024)
Scaling nnU-Net for CBCT Segmentation
par: Isensee, Fabian, et autres
Publié: (2024)
par: Isensee, Fabian, et autres
Publié: (2024)
MedNeXt: Transformer-driven Scaling of ConvNets for Medical Image Segmentation
par: Roy, Saikat, et autres
Publié: (2023)
par: Roy, Saikat, et autres
Publié: (2023)
MultiTalent: A Multi-Dataset Approach to Medical Image Segmentation
par: Ulrich, Constantin, et autres
Publié: (2023)
par: Ulrich, Constantin, et autres
Publié: (2023)
Data-Centric Strategies for Overcoming PET/CT Heterogeneity: Insights from the AutoPET III Lesion Segmentation Challenge
par: Kovacs, Balint, et autres
Publié: (2024)
par: Kovacs, Balint, et autres
Publié: (2024)
ValUES: A Framework for Systematic Validation of Uncertainty Estimation in Semantic Segmentation
par: Kahl, Kim-Celine, et autres
Publié: (2024)
par: Kahl, Kim-Celine, et autres
Publié: (2024)
Comparative Benchmarking of Failure Detection Methods in Medical Image Segmentation: Unveiling the Role of Confidence Aggregation
par: Zenk, Maximilian, et autres
Publié: (2024)
par: Zenk, Maximilian, et autres
Publié: (2024)
RadioActive: 3D Radiological Interactive Segmentation Benchmark
par: Ulrich, Constantin, et autres
Publié: (2024)
par: Ulrich, Constantin, et autres
Publié: (2024)
nnActive: A Framework for Evaluation of Active Learning in 3D Biomedical Segmentation
par: Lüth, Carsten T., et autres
Publié: (2025)
par: Lüth, Carsten T., et autres
Publié: (2025)
Application-driven Validation of Posteriors in Inverse Problems
par: Adler, Tim J., et autres
Publié: (2023)
par: Adler, Tim J., et autres
Publié: (2023)
MedNeXt-v2: Scaling 3D ConvNeXts for Large-Scale Supervised Representation Learning in Medical Image Segmentation
par: Roy, Saikat, et autres
Publié: (2025)
par: Roy, Saikat, et autres
Publié: (2025)
MeisenMeister: A Simple Two Stage Pipeline for Breast Cancer Classification on MRI
par: Hamm, Benjamin, et autres
Publié: (2025)
par: Hamm, Benjamin, et autres
Publié: (2025)
From FDG to PSMA: A Hitchhiker's Guide to Multitracer, Multicenter Lesion Segmentation in PET/CT Imaging
par: Rokuss, Maximilian, et autres
Publié: (2024)
par: Rokuss, Maximilian, et autres
Publié: (2024)
Lost in the Folds: When Cross-Validation Is Not a Deep Ensemble for Uncertainty Estimation
par: Kirscher, Tristan, et autres
Publié: (2026)
par: Kirscher, Tristan, et autres
Publié: (2026)
Input Data Adaptive Learning (IDAL) for Sub-acute Ischemic Stroke Lesion Segmentation
par: Götz, Michael, et autres
Publié: (2024)
par: Götz, Michael, et autres
Publié: (2024)
Divide and Conquer: A Large-Scale Dataset and Model for Left-Right Breast MRI Segmentation
par: Rokuss, Maximilian, et autres
Publié: (2025)
par: Rokuss, Maximilian, et autres
Publié: (2025)
A Multi-Stage Fine-Tuning and Ensembling Strategy for Pancreatic Tumor Segmentation in Diagnostic and Therapeutic MRI
par: Durugol, Omer Faruk, et autres
Publié: (2025)
par: Durugol, Omer Faruk, et autres
Publié: (2025)
Enhancing predictive imaging biomarker discovery through treatment effect analysis
par: Xiao, Shuhan, et autres
Publié: (2024)
par: Xiao, Shuhan, et autres
Publié: (2024)
Primus: Enforcing Attention Usage for 3D Medical Image Segmentation
par: Wald, Tassilo, et autres
Publié: (2025)
par: Wald, Tassilo, et autres
Publié: (2025)
Decoupling Semantic Similarity from Spatial Alignment for Neural Networks
par: Wald, Tassilo, et autres
Publié: (2024)
par: Wald, Tassilo, et autres
Publié: (2024)
Finally Outshining the Random Baseline: A Simple and Effective Solution for Active Learning in 3D Biomedical Imaging
par: Lüth, Carsten T., et autres
Publié: (2026)
par: Lüth, Carsten T., et autres
Publié: (2026)
A Unified Framework for Foreground and Anonymization Area Segmentation in CT and MRI Data
par: Nohel, Michal, et autres
Publié: (2025)
par: Nohel, Michal, et autres
Publié: (2025)
Performance uncertainty in medical image analysis: a large-scale investigation of confidence intervals
par: André, Pascaline, et autres
Publié: (2026)
par: André, Pascaline, et autres
Publié: (2026)
Visual Prompt Engineering for Vision Language Models in Radiology
par: Denner, Stefan, et autres
Publié: (2024)
par: Denner, Stefan, et autres
Publié: (2024)
nnLandmark: A Self-Configuring Method for 3D Medical Landmark Detection
par: Ertl, Alexandra, et autres
Publié: (2025)
par: Ertl, Alexandra, et autres
Publié: (2025)
VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation
par: Rokuss, Maximilian, et autres
Publié: (2025)
par: Rokuss, Maximilian, et autres
Publié: (2025)
An OpenMind for 3D medical vision self-supervised learning
par: Wald, Tassilo, et autres
Publié: (2024)
par: Wald, Tassilo, et autres
Publié: (2024)
GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models
par: Jassim, Serwan, et autres
Publié: (2023)
par: Jassim, Serwan, et autres
Publié: (2023)
Documents similaires
-
6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models
par: Mayer, Leon, et autres
Publié: (2025) -
Quality Assured: Rethinking Annotation Strategies in Imaging AI
par: Rädsch, Tim, et autres
Publié: (2024) -
Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study
par: Mayer, Leon, et autres
Publié: (2025) -
Revisiting 3D Medical Scribble Supervision: Benchmarking Beyond Cardiac Segmentation
par: Gotkowski, Karol, et autres
Publié: (2024) -
Advancing standards in biomedical image analysis validation: A perspective on Metrics Reloaded
par: Annika Reinke, et autres
Publié: (2025)