MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Mianxin, Ding, Jinru, Xu, Jie, Hu, Weiguo, Li, Xiaoyang, Zhu, Lifeng, Bai, Zhian, Shi, Xiaoming, Wang, Benyou, Song, Haitao, Liu, Pengfei, Zhang, Xiaofan, Wang, Shanshan, Li, Kang, Wang, Haofen, Ruan, Tong, Huang, Xuanjing, Sun, Xin, Zhang, Shaoting |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
by: Jing, Miao, et al.
Published: (2025)
by: Jing, Miao, et al.
Published: (2025)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
by: Kozlova, Anna, et al.
Published: (2026)
by: Kozlova, Anna, et al.
Published: (2026)
MedLSAM: Localize and Segment Anything Model for 3D CT Images
by: Lei, Wenhui, et al.
Published: (2023)
by: Lei, Wenhui, et al.
Published: (2023)
MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens
by: Fan, Yongqi, et al.
Published: (2024)
by: Fan, Yongqi, et al.
Published: (2024)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
Cost-effective Instruction Learning for Pathology Vision and Language Analysis
by: Chen, Kaitao, et al.
Published: (2024)
by: Chen, Kaitao, et al.
Published: (2024)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
by: Yu, Yongrui, et al.
Published: (2024)
by: Yu, Yongrui, et al.
Published: (2024)
Exploring the Feasibility of Multimodal Chatbot AI as Copilot in Pathology Diagnostics: Generalist Model's Pitfall
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis
by: Zhu, Ning, et al.
Published: (2025)
by: Zhu, Ning, et al.
Published: (2025)
Multi-modal Vision Pre-training for Medical Image Analysis
by: Rui, Shaohao, et al.
Published: (2024)
by: Rui, Shaohao, et al.
Published: (2024)
MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph
by: Mu, Linjie, et al.
Published: (2025)
by: Mu, Linjie, et al.
Published: (2025)
Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting
by: Yu, Yongrui, et al.
Published: (2025)
by: Yu, Yongrui, et al.
Published: (2025)
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
by: Zhu, Yakun, et al.
Published: (2026)
by: Zhu, Yakun, et al.
Published: (2026)
Human or LLM as Standardized Patients? A Comparative Study for Medical Education
by: Zhang, Bingquan, et al.
Published: (2025)
by: Zhang, Bingquan, et al.
Published: (2025)
Medical Dialogue: A Survey of Categories, Methods, Evaluation and Challenges
by: Shi, Xiaoming, et al.
Published: (2024)
by: Shi, Xiaoming, et al.
Published: (2024)
SRPL-SFDA: SAM-Guided Reliable Pseudo-Labels for Source-Free Domain Adaptation in Medical Image Segmentation
by: Liu, Xinya, et al.
Published: (2025)
by: Liu, Xinya, et al.
Published: (2025)
DHG-Bench: A Comprehensive Benchmark for Deep Hypergraph Learning
by: Li, Fan, et al.
Published: (2025)
by: Li, Fan, et al.
Published: (2025)
Language-Enhanced Generative Modeling for Amyloid PET Synthesis from MRI and Blood Biomarkers
by: Zhang, Zhengjie, et al.
Published: (2025)
by: Zhang, Zhengjie, et al.
Published: (2025)
DeReStainer: H&E to IHC Pathological Image Translation via Decoupled Staining Channels
by: Wei, Linda, et al.
Published: (2024)
by: Wei, Linda, et al.
Published: (2024)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment
by: Jiang, Yankai, et al.
Published: (2024)
by: Jiang, Yankai, et al.
Published: (2024)
Leptin in Obesity‐Related Heart Failure: Pathophysiological Mechanisms and Therapeutic Implications
by: Xuemin Li, et al.
Published: (2026)
by: Xuemin Li, et al.
Published: (2026)
Tool Calling: Enhancing Medication Consultation via Retrieval-Augmented Large Language Models
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
Distributed Invariant Unscented Kalman Filter based on Inverse Covariance Intersection with Intermittent Measurements
by: Ruan, Zhian, et al.
Published: (2024)
by: Ruan, Zhian, et al.
Published: (2024)
O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning
by: Huang, Zhongzhen, et al.
Published: (2025)
by: Huang, Zhongzhen, et al.
Published: (2025)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
by: Yue, Jingkun, et al.
Published: (2025)
by: Yue, Jingkun, et al.
Published: (2025)
MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling
by: Zhu, Yakun, et al.
Published: (2024)
by: Zhu, Yakun, et al.
Published: (2024)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
by: Zhu, Yakun, et al.
Published: (2025)
by: Zhu, Yakun, et al.
Published: (2025)
End-to-end Triple-domain PET Enhancement: A Hybrid Denoising-and-reconstruction Framework for Reconstructing Standard-dose PET Images from Low-dose PET Sinograms
by: Jiang, Caiwen, et al.
Published: (2024)
by: Jiang, Caiwen, et al.
Published: (2024)
MedGo: A Chinese Medical Large Language Model
by: Zhang, Haitao, et al.
Published: (2024)
by: Zhang, Haitao, et al.
Published: (2024)
Preference-Guided Refactored Tuning for Retrieval Augmented Code Generation
by: Gao, Xinyu, et al.
Published: (2024)
by: Gao, Xinyu, et al.
Published: (2024)
ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-Prompting
by: Jiang, Yankai, et al.
Published: (2023)
by: Jiang, Yankai, et al.
Published: (2023)
CAT: Coordinating Anatomical-Textual Prompts for Multi-Organ and Tumor Segmentation
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
ProbRes: Volatility Learning for Probabilistic Time-Series Forecasting
by: Wang, Tingting, et al.
Published: (2026)
by: Wang, Tingting, et al.
Published: (2026)
Bench4Merge: A Comprehensive Benchmark for Merging in Realistic Dense Traffic with Micro-Interactive Vehicles
by: Wang, Zhengming, et al.
Published: (2024)
by: Wang, Zhengming, et al.
Published: (2024)
StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall
by: Wu, Yerong, et al.
Published: (2026)
by: Wu, Yerong, et al.
Published: (2026)
MedViLaM: A multimodal large language model with advanced generalizability and explainability for medical data understanding and generation
by: Xu, Lijian, et al.
Published: (2024)
by: Xu, Lijian, et al.
Published: (2024)
Med-Tuning: A New Parameter-Efficient Tuning Framework for Medical Volumetric Segmentation
by: Shen, Jiachen, et al.
Published: (2023)
by: Shen, Jiachen, et al.
Published: (2023)
MedForge: Building Medical Foundation Models Like Open Source Software Development
by: Tan, Zheling, et al.
Published: (2025)
by: Tan, Zheling, et al.
Published: (2025)
Similar Items
-
Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
by: Jing, Miao, et al.
Published: (2025) -
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025) -
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
by: Kozlova, Anna, et al.
Published: (2026) -
MedLSAM: Localize and Segment Anything Model for 3D CT Images
by: Lei, Wenhui, et al.
Published: (2023) -
MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens
by: Fan, Yongqi, et al.
Published: (2024)