MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies
Fuente:
arXiv
Saved in:
| Main Authors: | Ha, Huy Hoang, Favre, Benoit, Portet, Francois |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts
by: Li, Weiyue, et al.
Published: (2026)
by: Li, Weiyue, et al.
Published: (2026)
CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field
by: Bonzi, Doria, et al.
Published: (2025)
by: Bonzi, Doria, et al.
Published: (2025)
Can GPT models Follow Human Summarization Guidelines? A Study for Targeted Communication Goals
by: Zhou, Yongxin, et al.
Published: (2023)
by: Zhou, Yongxin, et al.
Published: (2023)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
by: Zhang, Ming, et al.
Published: (2025)
by: Zhang, Ming, et al.
Published: (2025)
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
by: Méloux, Maxime, et al.
Published: (2025)
by: Méloux, Maxime, et al.
Published: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
by: Wei, Jianhui, et al.
Published: (2025)
by: Wei, Jianhui, et al.
Published: (2025)
MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
by: Chen, Wenting, et al.
Published: (2026)
by: Chen, Wenting, et al.
Published: (2026)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
by: Zeng, Zhongshen, et al.
Published: (2024)
by: Zeng, Zhongshen, et al.
Published: (2024)
MedSEBA: Synthesizing Evidence-Based Answers Grounded in Evolving Medical Literature
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
by: Kim, Yunsoo, et al.
Published: (2024)
by: Kim, Yunsoo, et al.
Published: (2024)
Increasing faithfulness in human-human dialog summarization with Spoken Language Understanding tasks
by: Akani, Eunice, et al.
Published: (2024)
by: Akani, Eunice, et al.
Published: (2024)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
by: Huang, Yue, et al.
Published: (2025)
by: Huang, Yue, et al.
Published: (2025)
MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts
by: Xia, Shujun, et al.
Published: (2025)
by: Xia, Shujun, et al.
Published: (2025)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
by: Lu, Yuxing, et al.
Published: (2025)
by: Lu, Yuxing, et al.
Published: (2025)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
by: Rajgarhia, Harshit, et al.
Published: (2026)
by: Rajgarhia, Harshit, et al.
Published: (2026)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
by: Zuo, Kaiwen, et al.
Published: (2024)
by: Zuo, Kaiwen, et al.
Published: (2024)
ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
by: Ding, Hongxin, et al.
Published: (2025)
by: Ding, Hongxin, et al.
Published: (2025)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
by: Wu, Juncheng, et al.
Published: (2025)
by: Wu, Juncheng, et al.
Published: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
by: Liu, Yinhong, et al.
Published: (2025)
by: Liu, Yinhong, et al.
Published: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025)
by: He, Jiayi, et al.
Published: (2025)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
by: Shang, Fangxin, et al.
Published: (2025)
by: Shang, Fangxin, et al.
Published: (2025)
MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks
by: Veuthey, Jaime Raldua, et al.
Published: (2025)
by: Veuthey, Jaime Raldua, et al.
Published: (2025)
MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
by: Iwase, Naoto, et al.
Published: (2025)
by: Iwase, Naoto, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
by: Jin, Congyun, et al.
Published: (2024)
by: Jin, Congyun, et al.
Published: (2024)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
by: Yang, Lin, et al.
Published: (2026)
by: Yang, Lin, et al.
Published: (2026)
Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning
by: Zhang, Xiaotian, et al.
Published: (2025)
by: Zhang, Xiaotian, et al.
Published: (2025)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
by: Jamali, Naghmeh, et al.
Published: (2025)
by: Jamali, Naghmeh, et al.
Published: (2025)
MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs
by: Kwok, Tung Sum Thomas, et al.
Published: (2026)
by: Kwok, Tung Sum Thomas, et al.
Published: (2026)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
by: Daoud, Mouath Abu, et al.
Published: (2025)
by: Daoud, Mouath Abu, et al.
Published: (2025)
Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey
by: Bilal, Ahsan, et al.
Published: (2025)
by: Bilal, Ahsan, et al.
Published: (2025)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
by: Méloux, Maxime, et al.
Published: (2025)
by: Méloux, Maxime, et al.
Published: (2025)
MedGo: A Chinese Medical Large Language Model
by: Zhang, Haitao, et al.
Published: (2024)
by: Zhang, Haitao, et al.
Published: (2024)
MEMERAG: A Multilingual End-to-End Meta-Evaluation Benchmark for Retrieval Augmented Generation
by: Blandón, María Andrea Cruz, et al.
Published: (2025)
by: Blandón, María Andrea Cruz, et al.
Published: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
AI-Facilitated Analysis of Abstracts and Conclusions: Flagging Unsubstantiated Claims and Ambiguous Pronouns
by: Markhasin, Evgeny
Published: (2025)
by: Markhasin, Evgeny
Published: (2025)
Med42-v2: A Suite of Clinical LLMs
by: Christophe, Clément, et al.
Published: (2024)
by: Christophe, Clément, et al.
Published: (2024)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
by: Sui, Yuan, et al.
Published: (2026)
by: Sui, Yuan, et al.
Published: (2026)
Similar Items
-
MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts
by: Li, Weiyue, et al.
Published: (2026) -
CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field
by: Bonzi, Doria, et al.
Published: (2025) -
Can GPT models Follow Human Summarization Guidelines? A Study for Targeted Communication Goals
by: Zhou, Yongxin, et al.
Published: (2023) -
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
by: Zhang, Ming, et al.
Published: (2025) -
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
by: Méloux, Maxime, et al.
Published: (2025)