Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Liu, Yang, Yang, Jiyao, Zhao, Hongjin, Li, Xiaoyong, Ji, Yanzhe, Li, Xingjian, Jiang, Runmin, Wang, Tianyang, Anwar, Saeed, Kim, Dongwoo, Yao, Yue, Qin, Zhenyue, Xu, Min
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866908900430708736
author Liu, Yang
Yang, Jiyao
Zhao, Hongjin
Li, Xiaoyong
Ji, Yanzhe
Li, Xingjian
Jiang, Runmin
Wang, Tianyang
Anwar, Saeed
Kim, Dongwoo
Yao, Yue
Qin, Zhenyue
Xu, Min
author_facet Liu, Yang
Yang, Jiyao
Zhao, Hongjin
Li, Xiaoyong
Ji, Yanzhe
Li, Xingjian
Jiang, Runmin
Wang, Tianyang
Anwar, Saeed
Kim, Dongwoo
Yao, Yue
Qin, Zhenyue
Xu, Min
contents Large vision-language models (LVLMs) demonstrate strong performance in dermatology; however, evaluating diagnostic reasoning for rare conditions remains largely unexplored. Existing benchmarks focus on common diseases and assess only final accuracy, overlooking the clinical reasoning process, which is critical for complex cases. We address this gap by constructing DermCase, a long-context benchmark derived from peer-reviewed case reports. Our dataset contains 26,030 multi-modal image-text pairs and 6,354 clinically challenging cases, each annotated with comprehensive clinical information and step-by-step reasoning chains. To enable reliable evaluation, we establish DermLIP-based similarity metrics that achieve stronger alignment with dermatologists for assessing differential diagnosis quality. Benchmarking 22 leading LVLMs exposes significant deficiencies across diagnosis accuracy, differential diagnosis, and clinical reasoning. Fine-tuning experiments demonstrate that instruction tuning substantially improves performance while Direct Preference Optimization (DPO) yields minimal gains. Systematic error analysis further reveals critical limitations in current models' reasoning capabilities.
format Preprint
id arxiv_https___arxiv_org_abs_2603_18418
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?
Liu, Yang
Yang, Jiyao
Zhao, Hongjin
Li, Xiaoyong
Ji, Yanzhe
Li, Xingjian
Jiang, Runmin
Wang, Tianyang
Anwar, Saeed
Kim, Dongwoo
Yao, Yue
Qin, Zhenyue
Xu, Min
Computer Vision and Pattern Recognition
Artificial Intelligence
Large vision-language models (LVLMs) demonstrate strong performance in dermatology; however, evaluating diagnostic reasoning for rare conditions remains largely unexplored. Existing benchmarks focus on common diseases and assess only final accuracy, overlooking the clinical reasoning process, which is critical for complex cases. We address this gap by constructing DermCase, a long-context benchmark derived from peer-reviewed case reports. Our dataset contains 26,030 multi-modal image-text pairs and 6,354 clinically challenging cases, each annotated with comprehensive clinical information and step-by-step reasoning chains. To enable reliable evaluation, we establish DermLIP-based similarity metrics that achieve stronger alignment with dermatologists for assessing differential diagnosis quality. Benchmarking 22 leading LVLMs exposes significant deficiencies across diagnosis accuracy, differential diagnosis, and clinical reasoning. Fine-tuning experiments demonstrate that instruction tuning substantially improves performance while Direct Preference Optimization (DPO) yields minimal gains. Systematic error analysis further reveals critical limitations in current models' reasoning capabilities.
title Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2603.18418