Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Gupta, Arsh, Sridhar, Ajay Narayanan, Mingole, Bonam, Yadav, Amulya
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866915616774946816
author Gupta, Arsh
Sridhar, Ajay Narayanan
Mingole, Bonam
Yadav, Amulya
author_facet Gupta, Arsh
Sridhar, Ajay Narayanan
Mingole, Bonam
Yadav, Amulya
contents Large language models (LLMs) have demonstrated capabilities across diverse domains, yet their performance on rare disease diagnosis from narrative medical cases remains underexplored. We introduce a novel dataset of 176 symptom-diagnosis pairs extracted from House M.D., a medical television series validated for teaching rare disease recognition in medical education. We evaluate four state-of-the-art LLMs such as GPT 4o mini, GPT 5 mini, Gemini 2.5 Flash, and Gemini 2.5 Pro on narrative-based diagnostic reasoning tasks. Results show significant variation in performance, ranging from 16.48% to 38.64% accuracy, with newer model generations demonstrating a 2.3 times improvement. While all models face substantial challenges with rare disease diagnosis, the observed improvement across architectures suggests promising directions for future development. Our educationally validated benchmark establishes baseline performance metrics for narrative medical reasoning and provides a publicly accessible evaluation framework for advancing AI-assisted diagnosis research.
format Preprint
id arxiv_https___arxiv_org_abs_2511_10912
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D
Gupta, Arsh
Sridhar, Ajay Narayanan
Mingole, Bonam
Yadav, Amulya
Computation and Language
Artificial Intelligence
Large language models (LLMs) have demonstrated capabilities across diverse domains, yet their performance on rare disease diagnosis from narrative medical cases remains underexplored. We introduce a novel dataset of 176 symptom-diagnosis pairs extracted from House M.D., a medical television series validated for teaching rare disease recognition in medical education. We evaluate four state-of-the-art LLMs such as GPT 4o mini, GPT 5 mini, Gemini 2.5 Flash, and Gemini 2.5 Pro on narrative-based diagnostic reasoning tasks. Results show significant variation in performance, ranging from 16.48% to 38.64% accuracy, with newer model generations demonstrating a 2.3 times improvement. While all models face substantial challenges with rare disease diagnosis, the observed improvement across architectures suggests promising directions for future development. Our educationally validated benchmark establishes baseline performance metrics for narrative medical reasoning and provides a publicly accessible evaluation framework for advancing AI-assisted diagnosis research.
title Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D
topic Computation and Language
Artificial Intelligence
url https://arxiv.org/abs/2511.10912