MedicalBench: Evaluating Large Language Models Toward Improved Medical Concept Extraction
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Zhichao, Lyng, Gregory D., Batra, Sanjit Singh, Tillman, Robert E. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs
by: Kwok, Tung Sum Thomas, et al.
Published: (2026)
by: Kwok, Tung Sum Thomas, et al.
Published: (2026)
Health-SCORE: Towards Scalable Rubrics for Improving Health-LLMs
by: Yang, Zhichao, et al.
Published: (2026)
by: Yang, Zhichao, et al.
Published: (2026)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
by: Chen, Yuefei, et al.
Published: (2025)
by: Chen, Yuefei, et al.
Published: (2025)
HealthBench: Evaluating Large Language Models Towards Improved Human Health
by: Arora, Rahul K., et al.
Published: (2025)
by: Arora, Rahul K., et al.
Published: (2025)
POET: Protocol Optimization via Eligibility Tuning
by: Das, Trisha, et al.
Published: (2026)
by: Das, Trisha, et al.
Published: (2026)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024)
by: Ouyang, Zetian, et al.
Published: (2024)
Assessing Large Language Models for Structured Medical Order Extraction
by: Karim, A H M Rezaul, et al.
Published: (2025)
by: Karim, A H M Rezaul, et al.
Published: (2025)
CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculation
by: Yu, Guangya, et al.
Published: (2025)
by: Yu, Guangya, et al.
Published: (2025)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
by: Ren, Xiaohan, et al.
Published: (2026)
by: Ren, Xiaohan, et al.
Published: (2026)
Large Language Model-based Role-Playing for Personalized Medical Jargon Extraction
by: Lim, Jung Hoon, et al.
Published: (2024)
by: Lim, Jung Hoon, et al.
Published: (2024)
Fast and Effective On-policy Distillation from Reasoning Prefixes
by: Zhang, Dongxu, et al.
Published: (2026)
by: Zhang, Dongxu, et al.
Published: (2026)
Scalable Medication Extraction and Discontinuation Identification from Electronic Health Records Using Large Language Models
by: Shao, Chong, et al.
Published: (2025)
by: Shao, Chong, et al.
Published: (2025)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
by: Ren, Zhiyao, et al.
Published: (2026)
by: Ren, Zhiyao, et al.
Published: (2026)
Mitigating Hallucinations of Large Language Models in Medical Information Extraction via Contrastive Decoding
by: Xu, Derong, et al.
Published: (2024)
by: Xu, Derong, et al.
Published: (2024)
ESTAR: Early-Stopping Token-Aware Reasoning For Efficient Inference
by: Wang, Junda, et al.
Published: (2026)
by: Wang, Junda, et al.
Published: (2026)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
by: Zhou, Shuang, et al.
Published: (2025)
by: Zhou, Shuang, et al.
Published: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
by: Zhang, Junyi, et al.
Published: (2025)
by: Zhang, Junyi, et al.
Published: (2025)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
by: Liu, Junyu, et al.
Published: (2026)
by: Liu, Junyu, et al.
Published: (2026)
Systematic Comparative Analysis of Large Pretrained Language Models on Contextualized Medication Event Extraction
by: Abdul-Quddoos, Tariq, et al.
Published: (2025)
by: Abdul-Quddoos, Tariq, et al.
Published: (2025)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
by: Zuo, Kaiwen, et al.
Published: (2024)
by: Zuo, Kaiwen, et al.
Published: (2024)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
by: Abouzahir, Chaimae, et al.
Published: (2026)
by: Abouzahir, Chaimae, et al.
Published: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
ConExion: Concept Extraction with Large Language Models
by: Norouzi, Ebrahim, et al.
Published: (2025)
by: Norouzi, Ebrahim, et al.
Published: (2025)
A Comprehensive Survey on Evaluating Large Language Model Applications in the Medical Industry
by: Huang, Yining, et al.
Published: (2024)
by: Huang, Yining, et al.
Published: (2024)
Eir: Thai Medical Large Language Models
by: Thiprak, Yutthakorn, et al.
Published: (2024)
by: Thiprak, Yutthakorn, et al.
Published: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
by: Tu, Shangqing, et al.
Published: (2023)
by: Tu, Shangqing, et al.
Published: (2023)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
by: Zhang, Yazhou, et al.
Published: (2024)
by: Zhang, Yazhou, et al.
Published: (2024)
Generalization of Medical Large Language Models through Cross-Domain Weak Supervision
by: Long, Robert, et al.
Published: (2025)
by: Long, Robert, et al.
Published: (2025)
Evaluating Open-Weight Large Language Models for Structured Data Extraction from Narrative Medical Reports Across Multiple Use Cases and Languages
by: Spaanderman, Douwe J., et al.
Published: (2025)
by: Spaanderman, Douwe J., et al.
Published: (2025)
Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation
by: Adib, Shefayat E Shams, et al.
Published: (2026)
by: Adib, Shefayat E Shams, et al.
Published: (2026)
INSIGHTBUDDY-AI: Medication Extraction and Entity Linking using Large Language Models and Ensemble Learning
by: Romero, Pablo, et al.
Published: (2024)
by: Romero, Pablo, et al.
Published: (2024)
EHRmonize: A Framework for Medical Concept Abstraction from Electronic Health Records using Large Language Models
by: Matos, João, et al.
Published: (2024)
by: Matos, João, et al.
Published: (2024)
ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language Models
by: Ren, Yuanyi, et al.
Published: (2024)
by: Ren, Yuanyi, et al.
Published: (2024)
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
by: Krolik, Jack, et al.
Published: (2024)
by: Krolik, Jack, et al.
Published: (2024)
Pre-trained Language Models and Few-shot Learning for Medical Entity Extraction
by: Wang, Xiaokai, et al.
Published: (2025)
by: Wang, Xiaokai, et al.
Published: (2025)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
by: Bedi, Suhana, et al.
Published: (2025)
by: Bedi, Suhana, et al.
Published: (2025)
Similar Items
-
MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs
by: Kwok, Tung Sum Thomas, et al.
Published: (2026) -
Health-SCORE: Towards Scalable Rubrics for Improving Health-LLMs
by: Yang, Zhichao, et al.
Published: (2026) -
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024) -
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
by: Chen, Yuefei, et al.
Published: (2025) -
HealthBench: Evaluating Large Language Models Towards Improved Human Health
by: Arora, Rahul K., et al.
Published: (2025)