MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Mao, Kangkun, Ding, Jinru, Chen, Jiayuan, Bian, Mouxiao, Chen, Ruiyao, Peng, Xinwei, Ren, Sijie, Li, Linyang, Xu, Jie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024)
by: Khandekar, Nikhil, et al.
Published: (2024)
MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation
by: Krohn-Grimberghe, Artus
Published: (2026)
by: Krohn-Grimberghe, Artus
Published: (2026)
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
by: Zhu, Yakun, et al.
Published: (2026)
by: Zhu, Yakun, et al.
Published: (2026)
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025)
by: Ding, Jinru, et al.
Published: (2025)
ciCalc.C
by: Belasco, Kevin, et al.
Published: (2019)
by: Belasco, Kevin, et al.
Published: (2019)
Pre-Calc: Learning to Use the Calculator Improves Numeracy in Language Models
by: Veerendranath, Vishruth, et al.
Published: (2024)
by: Veerendranath, Vishruth, et al.
Published: (2024)
TaxCalcBench: Evaluating Frontier Models on the Tax Calculation Task
by: Bock, Michael R., et al.
Published: (2025)
by: Bock, Michael R., et al.
Published: (2025)
AstronomyCalc: A python toolkit for teaching Astronomical Calculations and Data Analysis methods
by: Giri, Sambit K.
Published: (2025)
by: Giri, Sambit K.
Published: (2025)
RI$-$Calc: A User Friendly Software and Web Server for Refractive Index Calculation
by: Benatto, Leandro, et al.
Published: (2024)
by: Benatto, Leandro, et al.
Published: (2024)
New multiloop capabilities of FeynCalc 10
by: Shtabovenko, Vladyslav
Published: (2024)
by: Shtabovenko, Vladyslav
Published: (2024)
Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescription Review
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
Benchmarking Ethical and Safety Risks of Healthcare LLMs in China-Toward Systemic Governance under Healthy China 2030
by: Bian, Mouxiao, et al.
Published: (2025)
by: Bian, Mouxiao, et al.
Published: (2025)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
by: Zhang, Xiechi, et al.
Published: (2025)
by: Zhang, Xiechi, et al.
Published: (2025)
A Library Application of the Apple VisiCalc Program.
by: Strazdon, Maureen E.
Published: (1981)
by: Strazdon, Maureen E.
Published: (1981)
SepsisCalc: Integrating Clinical Calculators into Early Sepsis Prediction via Dynamic Temporal Graph Construction
by: Yin, Changchang, et al.
Published: (2024)
by: Yin, Changchang, et al.
Published: (2024)
TensoriaCalc: A User-Friendly Tensor Calculus Package for the Wolfram Language
by: Chen, Wei-Hao, et al.
Published: (2025)
by: Chen, Wei-Hao, et al.
Published: (2025)
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
FeynCalc 10: Do multiloop integrals dream of computer codes?
by: Shtabovenko, Vladyslav, et al.
Published: (2023)
by: Shtabovenko, Vladyslav, et al.
Published: (2023)
MedVH: Toward Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
by: Zishan Gu, et al.
Published: (2025)
by: Zishan Gu, et al.
Published: (2025)
FeynCalc 10.2 and FeynHelpers 2: Multiloop calculations streamlined
by: Shtabovenko, Vladyslav
Published: (2025)
by: Shtabovenko, Vladyslav
Published: (2025)
dbt-calcfi-open-data: dbt package for CalcFi Open Data
by: Salmisto, Jere
Published: (2026)
by: Salmisto, Jere
Published: (2026)
NumCalc: An open source BEM code for solving acoustic scattering problems
by: Kreuzer, Wolfgang, et al.
Published: (2023)
by: Kreuzer, Wolfgang, et al.
Published: (2023)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2025)
by: Jin, Haoan, et al.
Published: (2025)
TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering
by: Zheng, Jinglai, et al.
Published: (2026)
by: Zheng, Jinglai, et al.
Published: (2026)
MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
by: Shen, Weixiang, et al.
Published: (2026)
by: Shen, Weixiang, et al.
Published: (2026)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025)
by: He, Jiayi, et al.
Published: (2025)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
by: Grolleau, François, et al.
Published: (2025)
by: Grolleau, François, et al.
Published: (2025)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
by: Xiao, Ying, et al.
Published: (2025)
by: Xiao, Ying, et al.
Published: (2025)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
Challenge Summary U-MedSAM: Uncertainty-aware MedSAM for Medical Image Segmentation
by: Wang, Xin, et al.
Published: (2024)
by: Wang, Xin, et al.
Published: (2024)
MedCore: Boundary-Preserving Medical Core Pruning for MedSAM
by: Zhang, Cenwei, et al.
Published: (2026)
by: Zhang, Cenwei, et al.
Published: (2026)
MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models
by: Royer, Corentin, et al.
Published: (2024)
by: Royer, Corentin, et al.
Published: (2024)
Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model
by: Ye, Qichen, et al.
Published: (2023)
by: Ye, Qichen, et al.
Published: (2023)
Lightweight Large Language Model for Medication Enquiry: Med-Pal
by: Elangovan, Kabilan, et al.
Published: (2024)
by: Elangovan, Kabilan, et al.
Published: (2024)
MedCare: Advancing Medical LLMs through Decoupling Clinical Alignment and Knowledge Aggregation
by: Liao, Yusheng, et al.
Published: (2024)
by: Liao, Yusheng, et al.
Published: (2024)
EpiPlanAgent: Agentic Automated Epidemic Response Planning
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgment
by: Li, Ruochen, et al.
Published: (2025)
by: Li, Ruochen, et al.
Published: (2025)
Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations
by: Pal, Ankit, et al.
Published: (2024)
by: Pal, Ankit, et al.
Published: (2024)
Similar Items
-
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
by: Khandekar, Nikhil, et al.
Published: (2024) -
MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation
by: Krohn-Grimberghe, Artus
Published: (2026) -
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
by: Zhu, Yakun, et al.
Published: (2026) -
MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
by: Ding, Jinru, et al.
Published: (2025) -
ciCalc.C
by: Belasco, Kevin, et al.
Published: (2019)