Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Pengcheng, Wu, Chaoyi, Liu, Shuyu, Zhao, Weike, Chen, Zhuoxia, Gu, Hongfei, Peng, Chuanjin, Zhang, Ya, Wang, Yanfeng, Xie, Weidi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Evaluating and Building Versatile Large Language Models for Medicine
par: Wu, Chaoyi, et autres
Publié: (2024)
par: Wu, Chaoyi, et autres
Publié: (2024)
RaTEScore: A Metric for Radiology Report Generation
par: Zhao, Weike, et autres
Publié: (2024)
par: Zhao, Weike, et autres
Publié: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
par: Liang, Cheng, et autres
Publié: (2026)
par: Liang, Cheng, et autres
Publié: (2026)
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
par: Zheng, Qiaoyu, et autres
Publié: (2025)
par: Zheng, Qiaoyu, et autres
Publié: (2025)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
par: Fan, Ziqing, et autres
Publié: (2025)
par: Fan, Ziqing, et autres
Publié: (2025)
Towards Building Multilingual Language Model for Medicine
par: Qiu, Pengcheng, et autres
Publié: (2024)
par: Qiu, Pengcheng, et autres
Publié: (2024)
An Agentic System for Rare Disease Diagnosis with Traceable Reasoning
par: Zhao, Weike, et autres
Publié: (2025)
par: Zhao, Weike, et autres
Publié: (2025)
Evolving Interactive Diagnostic Agents in a Virtual Clinical Environment
par: Qiu, Pengcheng, et autres
Publié: (2025)
par: Qiu, Pengcheng, et autres
Publié: (2025)
How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?
par: Zheng, Qiaoyu, et autres
Publié: (2024)
par: Zheng, Qiaoyu, et autres
Publié: (2024)
M^3Builder: A Multi-Agent System for Automated Machine Learning in Medical Imaging
par: Feng, Jinghao, et autres
Publié: (2025)
par: Feng, Jinghao, et autres
Publié: (2025)
EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis
par: Liao, Yusheng, et autres
Publié: (2025)
par: Liao, Yusheng, et autres
Publié: (2025)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
Disentangling Memory and Reasoning Ability in Large Language Models
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
Large-scale Long-tailed Disease Diagnosis on Radiology Images
par: Zheng, Qiaoyu, et autres
Publié: (2023)
par: Zheng, Qiaoyu, et autres
Publié: (2023)
Knowledge-enhanced Visual-Language Pretraining for Computational Pathology
par: Zhou, Xiao, et autres
Publié: (2024)
par: Zhou, Xiao, et autres
Publié: (2024)
Effective Distillation of Table-based Reasoning Ability from LLMs
par: Yang, Bohao, et autres
Publié: (2023)
par: Yang, Bohao, et autres
Publié: (2023)
RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining
par: Zhang, Tengfei, et autres
Publié: (2025)
par: Zhang, Tengfei, et autres
Publié: (2025)
RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis
par: Zhang, Xiaoman, et autres
Publié: (2024)
par: Zhang, Xiaoman, et autres
Publié: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
Diversity of Thought Improves Reasoning Abilities of LLMs
par: Naik, Ranjita, et autres
Publié: (2023)
par: Naik, Ranjita, et autres
Publié: (2023)
Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
par: Kuang, Jiayi, et autres
Publié: (2025)
par: Kuang, Jiayi, et autres
Publié: (2025)
Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
par: Xiao, Yunpeng, et autres
Publié: (2025)
par: Xiao, Yunpeng, et autres
Publié: (2025)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
Large-Vocabulary Segmentation for Medical Images with Text Prompts
par: Zhao, Ziheng, et autres
Publié: (2023)
par: Zhao, Ziheng, et autres
Publié: (2023)
Code Prompting Elicits Conditional Reasoning Abilities in Text+Code LLMs
par: Puerto, Haritz, et autres
Publié: (2024)
par: Puerto, Haritz, et autres
Publié: (2024)
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
Sibyl: Simple yet Effective Agent Framework for Complex Real-world Reasoning
par: Wang, Yulong, et autres
Publié: (2024)
par: Wang, Yulong, et autres
Publié: (2024)
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text
par: Wu, Jiageng, et autres
Publié: (2025)
par: Wu, Jiageng, et autres
Publié: (2025)
LLAMADRS: Evaluating Open-Source LLMs on Real Clinical Interviews--To Reason or Not to Reason?
par: Kebe, Gaoussou Youssouf, et autres
Publié: (2025)
par: Kebe, Gaoussou Youssouf, et autres
Publié: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
par: Ouyang, Zetian, et autres
Publié: (2024)
par: Ouyang, Zetian, et autres
Publié: (2024)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
par: Deng, Ken, et autres
Publié: (2024)
par: Deng, Ken, et autres
Publié: (2024)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
par: Chen, Zui, et autres
Publié: (2024)
par: Chen, Zui, et autres
Publié: (2024)
Are LLMs Models of Distributional Semantics? A Case Study on Quantifiers
par: Enyan, Zhang, et autres
Publié: (2024)
par: Enyan, Zhang, et autres
Publié: (2024)
ALFA: Aligning LLMs to Ask Good Questions A Case Study in Clinical Reasoning
par: Li, Shuyue Stella, et autres
Publié: (2025)
par: Li, Shuyue Stella, et autres
Publié: (2025)
Documents similaires
-
Towards Evaluating and Building Versatile Large Language Models for Medicine
par: Wu, Chaoyi, et autres
Publié: (2024) -
RaTEScore: A Metric for Radiology Report Generation
par: Zhao, Weike, et autres
Publié: (2024) -
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
par: Liang, Cheng, et autres
Publié: (2026) -
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
par: Zheng, Qiaoyu, et autres
Publié: (2025) -
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
par: Fan, Ziqing, et autres
Publié: (2025)