Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Vishwanath, Krithik, Ghosh, Mrigayu, Alyakin, Anton, Alber, Daniel Alexander, Aphinyanaphongs, Yindalon, Oermann, Eric Karl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MedMobile: A mobile-sized language model with clinical capabilities
di: Vishwanath, Krithik, et al.
Pubblicazione: (2024)
di: Vishwanath, Krithik, et al.
Pubblicazione: (2024)
Evaluating the performance and fragility of large language models on the self-assessment for neurological surgeons
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025)
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025)
Medical large language models are easily distracted
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025)
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025)
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
di: Rahman, Salman, et al.
Pubblicazione: (2024)
di: Rahman, Salman, et al.
Pubblicazione: (2024)
Generalist Foundation Models Are Not Clinical Enough for Hospital Operations
di: Jiang, Lavender Y., et al.
Pubblicazione: (2025)
di: Jiang, Lavender Y., et al.
Pubblicazione: (2025)
BPQA Dataset: Evaluating How Well Language Models Leverage Blood Pressures to Answer Biomedical Questions
di: Hang, Chi, et al.
Pubblicazione: (2025)
di: Hang, Chi, et al.
Pubblicazione: (2025)
It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education
di: Singh, Shrutika, et al.
Pubblicazione: (2025)
di: Singh, Shrutika, et al.
Pubblicazione: (2025)
Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization
di: Van Veen, Dave, et al.
Pubblicazione: (2023)
di: Van Veen, Dave, et al.
Pubblicazione: (2023)
CNS-Obsidian: A Neurosurgical Vision-Language Model Built From Scientific Publications
di: Alyakin, Anton, et al.
Pubblicazione: (2025)
di: Alyakin, Anton, et al.
Pubblicazione: (2025)
Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation
di: Dua, Radhika, et al.
Pubblicazione: (2025)
di: Dua, Radhika, et al.
Pubblicazione: (2025)
Biomedical Large Languages Models Seem not to be Superior to Generalist Models on Unseen Medical Data
di: Dorfner, Felix J., et al.
Pubblicazione: (2024)
di: Dorfner, Felix J., et al.
Pubblicazione: (2024)
On the Relationship Between the Choice of Representation and In-Context Learning
di: Marinescu, Ioana, et al.
Pubblicazione: (2025)
di: Marinescu, Ioana, et al.
Pubblicazione: (2025)
Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models
di: Chen, Yanbing, et al.
Pubblicazione: (2024)
di: Chen, Yanbing, et al.
Pubblicazione: (2024)
Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2025)
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2025)
From Generalist to Specialist: Improving Large Language Models for Medical Physics Using ARCoT
di: Grandinetti, Jace, et al.
Pubblicazione: (2024)
di: Grandinetti, Jace, et al.
Pubblicazione: (2024)
Generalist Reward Models: Found Inside Large Language Models
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
di: Li, Yi-Chen, et al.
Pubblicazione: (2025)
Generalists vs. Specialists: Evaluating Large Language Models for Urdu
di: Arif, Samee, et al.
Pubblicazione: (2024)
di: Arif, Samee, et al.
Pubblicazione: (2024)
"All You Need" is Not All You Need for a Paper Title: On the Origins of a Scientific Meme
di: Alyakin, Anton
Pubblicazione: (2025)
di: Alyakin, Anton
Pubblicazione: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
di: Guo, Zhicheng, et al.
Pubblicazione: (2024)
Towards Generalist Prompting for Large Language Models by Mental Models
di: Guan, Haoxiang, et al.
Pubblicazione: (2024)
di: Guan, Haoxiang, et al.
Pubblicazione: (2024)
Bigger But Not Better: Small Neural Language Models Outperform Large Language Models in Detection of Thought Disorder
di: Li, Changye, et al.
Pubblicazione: (2025)
di: Li, Changye, et al.
Pubblicazione: (2025)
Large Language Model Benchmarks in Medical Tasks
di: Yan, Lawrence K. Q., et al.
Pubblicazione: (2024)
di: Yan, Lawrence K. Q., et al.
Pubblicazione: (2024)
TESS 2: A Large-Scale Generalist Diffusion Language Model
di: Tae, Jaesung, et al.
Pubblicazione: (2025)
di: Tae, Jaesung, et al.
Pubblicazione: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
MatTools: Benchmarking Large Language Models for Materials Science Tools
di: Liu, Siyu, et al.
Pubblicazione: (2025)
di: Liu, Siyu, et al.
Pubblicazione: (2025)
The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models
di: Abdullahi, Tassallah, et al.
Pubblicazione: (2026)
di: Abdullahi, Tassallah, et al.
Pubblicazione: (2026)
Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models
di: Cao, Jinghan, et al.
Pubblicazione: (2026)
di: Cao, Jinghan, et al.
Pubblicazione: (2026)
UltraMedical: Building Specialized Generalists in Biomedicine
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
di: Zhang, Yubo, et al.
Pubblicazione: (2024)
di: Zhang, Yubo, et al.
Pubblicazione: (2024)
Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions
di: Chen, Hanjie, et al.
Pubblicazione: (2024)
di: Chen, Hanjie, et al.
Pubblicazione: (2024)
Medical Large Language Model Benchmarks Should Prioritize Construct Validity
di: Alaa, Ahmed, et al.
Pubblicazione: (2025)
di: Alaa, Ahmed, et al.
Pubblicazione: (2025)
Accurate and Energy Efficient: Local Retrieval-Augmented Generation Models Outperform Commercial Large Language Models in Medical Tasks
di: Vrettos, Konstantinos, et al.
Pubblicazione: (2025)
di: Vrettos, Konstantinos, et al.
Pubblicazione: (2025)
Tool Calling: Enhancing Medication Consultation via Retrieval-Augmented Large Language Models
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
di: Huang, Zhongzhen, et al.
Pubblicazione: (2024)
LoLCATs: On Low-Rank Linearizing of Large Language Models
di: Zhang, Michael, et al.
Pubblicazione: (2024)
di: Zhang, Michael, et al.
Pubblicazione: (2024)
InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
Large Language Models in the Clinic: A Comprehensive Benchmark
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
di: Liu, Fenglin, et al.
Pubblicazione: (2024)
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
di: Ye, Junjie, et al.
Pubblicazione: (2025)
di: Ye, Junjie, et al.
Pubblicazione: (2025)
MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
di: Li, Xiaomin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MedMobile: A mobile-sized language model with clinical capabilities
di: Vishwanath, Krithik, et al.
Pubblicazione: (2024) -
Evaluating the performance and fragility of large language models on the self-assessment for neurological surgeons
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025) -
Medical large language models are easily distracted
di: Vishwanath, Krithik, et al.
Pubblicazione: (2025) -
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026) -
Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
di: Rahman, Salman, et al.
Pubblicazione: (2024)