MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Ding, Jinru, Lu, Lu, Ding, Chao, Bian, Mouxiao, Chen, Jiayuan, Pang, Wenrao, Chen, Ruiyao, Peng, Xinwei, Lu, Renjie, Ren, Sijie, Zhu, Guanxu, Wu, Xiaoqin, Liu, Zhiqiang, Zhang, Rongzhao, Jiang, Luyi, Han, Bing, Wang, Yunqiu, Xu, Jie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
by: Bian, Mouxiao, et al.
Published: (2025)
by: Bian, Mouxiao, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
Beyond Knowledge to Agency: Evaluating Expertise, Autonomy, and Integrity in Finance with CNFinBench
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
by: Jiang, Luyi, et al.
Published: (2025)
by: Jiang, Luyi, et al.
Published: (2025)
Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
by: Jing, Miao, et al.
Published: (2025)
by: Jing, Miao, et al.
Published: (2025)
Doctorina MedBench: End-to-End Evaluation of Agent-Based Medical AI
by: Kozlova, Anna, et al.
Published: (2026)
by: Kozlova, Anna, et al.
Published: (2026)
MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
by: Lazzaroni, Ruggero Marino, et al.
Published: (2025)
Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidelines in Randomized Controlled Trials: A Methodological Evaluation Study
by: He, Zhichao, et al.
Published: (2025)
by: He, Zhichao, et al.
Published: (2025)
Large Language Models for Anomaly and Out-of-Distribution Detection: A Survey
by: Xu, Ruiyao, et al.
Published: (2024)
by: Xu, Ruiyao, et al.
Published: (2024)
RETRACTED: Dual drivers of plant invasions: Enemy release and enhanced mutualisms
by: Luwei Wang, et al.
Published: (2025)
by: Luwei Wang, et al.
Published: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
by: Zhang, Rongzhao, et al.
Published: (2025)
by: Zhang, Rongzhao, et al.
Published: (2025)
TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine
by: Huang, Tianai, et al.
Published: (2025)
by: Huang, Tianai, et al.
Published: (2025)
iclight_sd15_fbc
by: Lu, Jiayuan
Published: (2025)
by: Lu, Jiayuan
Published: (2025)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
by: Xu, Run, et al.
Published: (2026)
by: Xu, Run, et al.
Published: (2026)
Flag-Transitive 2-v,5,λ Designs Admitting a Two-Dimensional Projective Group
by: Suyun Ding, et al.
Published: (2024)
by: Suyun Ding, et al.
Published: (2024)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
Through the Valley: Path to Effective Long CoT Training for Small Language Models
by: Luo, Renjie, et al.
Published: (2025)
by: Luo, Renjie, et al.
Published: (2025)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
by: Fu, Yicheng, et al.
Published: (2025)
by: Fu, Yicheng, et al.
Published: (2025)
A Novel Ophthalmic Benchmark for Evaluating Multimodal Large Language Models with Fundus Photographs and OCT Images
by: Liang, Xiaoyi, et al.
Published: (2025)
by: Liang, Xiaoyi, et al.
Published: (2025)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
by: Wang, Yihao, et al.
Published: (2026)
by: Wang, Yihao, et al.
Published: (2026)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
by: Xu, Yunqiu, et al.
Published: (2024)
by: Xu, Yunqiu, et al.
Published: (2024)
VCEMO: Multi-Modal Emotion Recognition for Chinese Voiceprints
by: Tang, Jinghua, et al.
Published: (2024)
by: Tang, Jinghua, et al.
Published: (2024)
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
by: Yang, Jingyi, et al.
Published: (2025)
by: Yang, Jingyi, et al.
Published: (2025)
Wide band magnetometry based on color centers with transverse zero-field splitting
by: Ding, Xiayan, et al.
Published: (2025)
by: Ding, Xiayan, et al.
Published: (2025)
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
by: Huang, Tianai, et al.
Published: (2025)
by: Huang, Tianai, et al.
Published: (2025)
MedVH: Toward Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
by: Zishan Gu, et al.
Published: (2025)
by: Zishan Gu, et al.
Published: (2025)
Damage Process Criterion for the Concrete Dam in Geomechanical Model Test
by: Jianghan Xue, et al.
Published: (2024)
by: Jianghan Xue, et al.
Published: (2024)
Two-barriers-reflected BSDE with Rank-based Data
by: Feng, Xinwei, et al.
Published: (2024)
by: Feng, Xinwei, et al.
Published: (2024)
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
by: Luo, Renjie, et al.
Published: (2025)
by: Luo, Renjie, et al.
Published: (2025)
Building a Human-Verified Clinical Reasoning Dataset via a Human LLM Hybrid Pipeline for Trustworthy Medical AI
by: Ding, Chao, et al.
Published: (2025)
by: Ding, Chao, et al.
Published: (2025)
MedMNIST-NAS-Bench: A Tabular Neural Architecture Search Benchmark on MedMNIST v2
by: Wang, Wei (William)
Published: (2026)
by: Wang, Wei (William)
Published: (2026)
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
by: Chen, Guanxu, et al.
Published: (2026)
by: Chen, Guanxu, et al.
Published: (2026)
Viscosity solutions for mean field optimal switching with a two-time-scale Markov chain
by: Chen, Tian, et al.
Published: (2024)
by: Chen, Tian, et al.
Published: (2024)
Chinese-Vicuna: A Chinese Instruction-following Llama-based Model
by: Fan, Chenghao, et al.
Published: (2025)
by: Fan, Chenghao, et al.
Published: (2025)
RiskBench: A Scenario-based Benchmark for Risk Identification
by: Kung, Chi-Hsi, et al.
Published: (2023)
by: Kung, Chi-Hsi, et al.
Published: (2023)
SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?
by: Lu, Xudong, et al.
Published: (2025)
by: Lu, Xudong, et al.
Published: (2025)
Similar Items
-
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025) -
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
by: Bian, Mouxiao, et al.
Published: (2025) -
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024) -
Beyond Knowledge to Agency: Evaluating Expertise, Autonomy, and Integrity in Finance with CNFinBench
by: Ding, Jinru, et al.
Published: (2025) -
Benchmarking Chinese Medical LLMs: A Medbench-based Analysis of Performance Gaps and Hierarchical Optimization Strategies
by: Jiang, Luyi, et al.
Published: (2025)