CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Mingyu Derek, Ye, Chenchen, Yan, Yu, Wang, Xiaoxuan, Ping, Peipei, Chang, Timothy S, Wang, Wei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024)
by: Ouyang, Zetian, et al.
Published: (2024)
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
by: Ma, Mingyu Derek, et al.
Published: (2025)
by: Ma, Mingyu Derek, et al.
Published: (2025)
CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records
by: Li, Dongchen, et al.
Published: (2025)
by: Li, Dongchen, et al.
Published: (2025)
Multigranular Evaluation for Brain Visual Decoding
by: Xia, Weihao, et al.
Published: (2025)
by: Xia, Weihao, et al.
Published: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
by: Zhang, Junkai, et al.
Published: (2025)
by: Zhang, Junkai, et al.
Published: (2025)
Entropy-Based Adaptive Weighting for Self-Training
by: Wang, Xiaoxuan, et al.
Published: (2025)
by: Wang, Xiaoxuan, et al.
Published: (2025)
BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
by: Yang, Fuyi, et al.
Published: (2025)
by: Yang, Fuyi, et al.
Published: (2025)
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
by: Ma, Mingyu Derek, et al.
Published: (2023)
by: Ma, Mingyu Derek, et al.
Published: (2023)
MIRAI: Evaluating LLM Agents for Event Forecasting
by: Ye, Chenchen, et al.
Published: (2024)
by: Ye, Chenchen, et al.
Published: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
by: Zhang, Yubo, et al.
Published: (2024)
by: Zhang, Yubo, et al.
Published: (2024)
MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models
by: Li, Xiaomin, et al.
Published: (2025)
by: Li, Xiaomin, et al.
Published: (2025)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
by: Xie, Yunfei, et al.
Published: (2024)
by: Xie, Yunfei, et al.
Published: (2024)
Are Large-Language Models Graph Algorithmic Reasoners?
by: Taylor, Alexander K, et al.
Published: (2024)
by: Taylor, Alexander K, et al.
Published: (2024)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023)
by: Wang, Xiaoxuan, et al.
Published: (2023)
CCD-Bench: Probing Cultural Conflict in Large Language Model Decision-Making
by: Rahman, Hasibur, et al.
Published: (2025)
by: Rahman, Hasibur, et al.
Published: (2025)
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
by: Watanabe, Yusuke, et al.
Published: (2026)
by: Watanabe, Yusuke, et al.
Published: (2026)
CliMB: An AI-enabled Partner for Clinical Predictive Modeling
by: Saveliev, Evgeny, et al.
Published: (2024)
by: Saveliev, Evgeny, et al.
Published: (2024)
Clinical Utility of Plasma Biomarkers of Alzheimer's Disease (CliPAD)
by: Juli Cehula, et al.
Published: (2025)
by: Juli Cehula, et al.
Published: (2025)
Instructional Fingerprinting of Large Language Models
by: Xu, Jiashu, et al.
Published: (2024)
by: Xu, Jiashu, et al.
Published: (2024)
VulDetectBench: Evaluating the Deep Capability of Vulnerability Detection with Large Language Models
by: Liu, Yu, et al.
Published: (2024)
by: Liu, Yu, et al.
Published: (2024)
Memory-Driven Self-Improvement for Decision Making with Large Language Models
by: Yan, Xue, et al.
Published: (2025)
by: Yan, Xue, et al.
Published: (2025)
UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models
by: Qin, Zhanyue, et al.
Published: (2024)
by: Qin, Zhanyue, et al.
Published: (2024)
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
CUTS: A Deep Learning and Topological Framework for Multigranular Unsupervised Medical Image Segmentation
by: Liu, Chen, et al.
Published: (2022)
by: Liu, Chen, et al.
Published: (2022)
Reflection-Bench: Evaluating Epistemic Agency in Large Language Models
by: Li, Lingyu, et al.
Published: (2024)
by: Li, Lingyu, et al.
Published: (2024)
A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting
by: Chang, He, et al.
Published: (2024)
by: Chang, He, et al.
Published: (2024)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
by: He, Jiashu, et al.
Published: (2024)
by: He, Jiashu, et al.
Published: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
by: Xu, Jiashu, et al.
Published: (2023)
by: Xu, Jiashu, et al.
Published: (2023)
A Large-Scale Simulation on Large Language Models for Decision-Making in Political Science
by: Yu, Chenxiao, et al.
Published: (2024)
by: Yu, Chenxiao, et al.
Published: (2024)
Debt Collection Negotiations with Large Language Models: An Evaluation System and Optimizing Decision Making with Multi-Agent
by: Wang, Xiaofeng, et al.
Published: (2025)
by: Wang, Xiaofeng, et al.
Published: (2025)
Machine Learning–Based Radiomics for Differentiating Pancreatic Lesions: A Potential Tool to Enhance Clinical Decision‐Making and Nursing Management
by: Xiaoxuan Li, et al.
Published: (2025)
by: Xiaoxuan Li, et al.
Published: (2025)
Explainable Biomedical Hypothesis Generation via Retrieval Augmented Generation enabled Large Language Models
by: Pelletier, Alexander R., et al.
Published: (2024)
by: Pelletier, Alexander R., et al.
Published: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
by: Huang, Zhijian, et al.
Published: (2024)
by: Huang, Zhijian, et al.
Published: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
by: Li, Kai, et al.
Published: (2025)
by: Li, Kai, et al.
Published: (2025)
LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving
by: Sha, Hao, et al.
Published: (2023)
by: Sha, Hao, et al.
Published: (2023)
CliME: Evaluating Multimodal Climate Discourse on Social Media and the Climate Alignment Quotient (CAQ)
by: Borah, Abhilekh, et al.
Published: (2025)
by: Borah, Abhilekh, et al.
Published: (2025)
RTR conference 2025 - CliMAFlux
by: Vansompel, Hendrik
Published: (2025)
by: Vansompel, Hendrik
Published: (2025)
Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making
by: Huang, Jen-tse, et al.
Published: (2026)
by: Huang, Jen-tse, et al.
Published: (2026)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
Similar Items
-
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024) -
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
by: Ma, Mingyu Derek, et al.
Published: (2025) -
CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records
by: Li, Dongchen, et al.
Published: (2025) -
Multigranular Evaluation for Brain Visual Decoding
by: Xia, Weihao, et al.
Published: (2025) -
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
by: Zhang, Junkai, et al.
Published: (2025)