Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yan, Bian, Mouxiao, Li, Peiling, Wen, Bingjian, Chen, Ruiyao, Mao, Kangkun, Ye, Xiaojun, Li, Tianbin, Chen, Pengcheng, Han, Bing, Xu, Jie, Qiu, Kaifeng, Wu, Junyan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
by: He, Zhichao, et al.
Published: (2025)
by: He, Zhichao, et al.
Published: (2025)
Building a Human-Verified Clinical Reasoning Dataset via a Human LLM Hybrid Pipeline for Trustworthy Medical AI
by: Ding, Chao, et al.
Published: (2025)
by: Ding, Chao, et al.
Published: (2025)
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
by: Huang, Tianai, et al.
Published: (2025)
by: Huang, Tianai, et al.
Published: (2025)
A Novel Ophthalmic Benchmark for Evaluating Multimodal Large Language Models with Fundus Photographs and OCT Images
by: Liang, Xiaoyi, et al.
Published: (2025)
by: Liang, Xiaoyi, et al.
Published: (2025)
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
by: Bian, Mouxiao, et al.
Published: (2025)
by: Bian, Mouxiao, et al.
Published: (2025)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
PharmacyGPT: The AI Pharmacist
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
by: Zong, Yi, et al.
Published: (2024)
by: Zong, Yi, et al.
Published: (2024)
Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning
by: Luo, Qi, et al.
Published: (2025)
by: Luo, Qi, et al.
Published: (2025)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
by: Ni, Zhenliang, et al.
Published: (2025)
by: Ni, Zhenliang, et al.
Published: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
by: Chen, Yi, et al.
Published: (2023)
by: Chen, Yi, et al.
Published: (2023)
ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
by: Li, Yuchong, et al.
Published: (2025)
by: Li, Yuchong, et al.
Published: (2025)
Towards Lossless Ultimate Vision Token Compression for VLMs
by: Zheng, Dehua, et al.
Published: (2025)
by: Zheng, Dehua, et al.
Published: (2025)
ID-XCB: Data-independent Debiasing for Fair and Accurate Transformer-based Cyberbullying Detection
by: Yi, Peiling, et al.
Published: (2024)
by: Yi, Peiling, et al.
Published: (2024)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents
by: Wu, Kaifeng, et al.
Published: (2025)
by: Wu, Kaifeng, et al.
Published: (2025)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
by: Huang, Mouxiao, et al.
Published: (2025)
by: Huang, Mouxiao, et al.
Published: (2025)
Interactive Medical Image Segmentation: A Benchmark Dataset and Baseline
by: Cheng, Junlong, et al.
Published: (2024)
by: Cheng, Junlong, et al.
Published: (2024)
CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
FuturePrism: Supporting Adolescence in Collaborative Storytelling to Cope with Future Uncertainty
by: Chen, Yonglin, et al.
Published: (2026)
by: Chen, Yonglin, et al.
Published: (2026)
Diverse Image Harmonization
by: Tao, Xinhao, et al.
Published: (2024)
by: Tao, Xinhao, et al.
Published: (2024)
Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels
by: Yan, Jianhao, et al.
Published: (2024)
by: Yan, Jianhao, et al.
Published: (2024)
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
by: Zhu, Lei, et al.
Published: (2026)
by: Zhu, Lei, et al.
Published: (2026)
Machine Generated Product Advertisements: Benchmarking LLMs Against Human Performance
by: Ghosh, Sanjukta
Published: (2024)
by: Ghosh, Sanjukta
Published: (2024)
UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
by: He, Jun, et al.
Published: (2025)
by: He, Jun, et al.
Published: (2025)
From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents
by: Qu, Jinxian, et al.
Published: (2026)
by: Qu, Jinxian, et al.
Published: (2026)
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
by: Song, Zirui, et al.
Published: (2025)
by: Song, Zirui, et al.
Published: (2025)
Orca: Browsing at Scale Through User-Driven and AI-Facilitated Orchestration Across Malleable Webpages
by: Jiang, Peiling, et al.
Published: (2025)
by: Jiang, Peiling, et al.
Published: (2025)
MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models
by: Chen, Boqi, et al.
Published: (2026)
by: Chen, Boqi, et al.
Published: (2026)
DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
EpiPlanAgent: Agentic Automated Epidemic Response Planning
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
by: Li, Bowen, et al.
Published: (2026)
by: Li, Bowen, et al.
Published: (2026)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
by: Li, Zheqing, et al.
Published: (2025)
by: Li, Zheqing, et al.
Published: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
by: Hu, Yutao, et al.
Published: (2024)
by: Hu, Yutao, et al.
Published: (2024)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
by: Yang, Tiankai, et al.
Published: (2024)
by: Yang, Tiankai, et al.
Published: (2024)
Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards
by: Hu, Zijing, et al.
Published: (2025)
by: Hu, Zijing, et al.
Published: (2025)
Large Language Models Leverage External Knowledge to Extend Clinical Insight Beyond Language Boundaries
by: Wu, Jiageng, et al.
Published: (2023)
by: Wu, Jiageng, et al.
Published: (2023)
A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding
by: Shen, Yiqing, et al.
Published: (2024)
by: Shen, Yiqing, et al.
Published: (2024)
Similar Items
-
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025) -
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
by: Zhu, Siyu, et al.
Published: (2025) -
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
by: He, Zhichao, et al.
Published: (2025) -
Building a Human-Verified Clinical Reasoning Dataset via a Human LLM Hybrid Pipeline for Trustworthy Medical AI
by: Ding, Chao, et al.
Published: (2025) -
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
by: Huang, Tianai, et al.
Published: (2025)