MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Qu, Zhan, Färber, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation
por: Bazoge, Adrien
Publicado: (2025)
por: Bazoge, Adrien
Publicado: (2025)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2024)
por: Li, Shuyue Stella, et al.
Publicado: (2024)
Can Hallucinations Help? Boosting LLMs for Drug Discovery
por: Yuan, Shuzhou, et al.
Publicado: (2025)
por: Yuan, Shuzhou, et al.
Publicado: (2025)
Knowledge Graph Structure as Prompt: Improving Small Language Models Capabilities for Knowledge-based Causal Discovery
por: Susanti, Yuni, et al.
Publicado: (2024)
por: Susanti, Yuni, et al.
Publicado: (2024)
Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
por: Wang, Qiongqiong, et al.
Publicado: (2025)
por: Wang, Qiongqiong, et al.
Publicado: (2025)
EnigmaEval: A Benchmark of Long Multimodal Reasoning Challenges
por: Wang, Clinton J., et al.
Publicado: (2025)
por: Wang, Clinton J., et al.
Publicado: (2025)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
por: Zhang, Mengyuan, et al.
Publicado: (2024)
por: Zhang, Mengyuan, et al.
Publicado: (2024)
From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark
por: Lei, Chao, et al.
Publicado: (2025)
por: Lei, Chao, et al.
Publicado: (2025)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
por: Wu, Juncheng, et al.
Publicado: (2025)
por: Wu, Juncheng, et al.
Publicado: (2025)
Vital Trace: Protocol-Constrained Patient-State Reasoning for Longitudinal Clinical Trajectories
por: Qu, Zhan, et al.
Publicado: (2026)
por: Qu, Zhan, et al.
Publicado: (2026)
Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs
por: Zi, Xing, et al.
Publicado: (2026)
por: Zi, Xing, et al.
Publicado: (2026)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
por: Huang, Zhongzhan, et al.
Publicado: (2025)
por: Huang, Zhongzhan, et al.
Publicado: (2025)
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
por: Schopf, Tim, et al.
Publicado: (2026)
por: Schopf, Tim, et al.
Publicado: (2026)
PertEval: Unveiling Real Knowledge Capacity of LLMs with Knowledge-Invariant Perturbations
por: Li, Jiatong, et al.
Publicado: (2024)
por: Li, Jiatong, et al.
Publicado: (2024)
Paths to Causality: Finding Informative Subgraphs Within Knowledge Graphs for Knowledge-Based Causal Discovery
por: Susanti, Yuni, et al.
Publicado: (2025)
por: Susanti, Yuni, et al.
Publicado: (2025)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
por: Gao, Zihan, et al.
Publicado: (2025)
por: Gao, Zihan, et al.
Publicado: (2025)
Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
por: Wang, Guoxin, et al.
Publicado: (2025)
por: Wang, Guoxin, et al.
Publicado: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Knowledge Reasoning Language Model: Unifying Knowledge and Language for Inductive Knowledge Graph Reasoning
por: Zhuo, Xingrui, et al.
Publicado: (2025)
por: Zhuo, Xingrui, et al.
Publicado: (2025)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
por: Lee, Yuho, et al.
Publicado: (2024)
por: Lee, Yuho, et al.
Publicado: (2024)
GeoEval: Benchmark for Evaluating LLMs and Multi-Modal Models on Geometry Problem-Solving
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
por: Yang, Langqi, et al.
Publicado: (2025)
por: Yang, Langqi, et al.
Publicado: (2025)
Med-U1: Incentivizing Unified Medical Reasoning in LLMs via Large-scale Reinforcement Learning
por: Zhang, Xiaotian, et al.
Publicado: (2025)
por: Zhang, Xiaotian, et al.
Publicado: (2025)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
por: Qiao, Shuofei, et al.
Publicado: (2026)
por: Qiao, Shuofei, et al.
Publicado: (2026)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
por: Yang, Jialin, et al.
Publicado: (2025)
por: Yang, Jialin, et al.
Publicado: (2025)
One Patient, Many Contexts: Scaling Medical AI with Contextual Intelligence
por: Li, Michelle M., et al.
Publicado: (2025)
por: Li, Michelle M., et al.
Publicado: (2025)
MediTools -- Medical Education Powered by LLMs
por: Alshatnawi, Amr, et al.
Publicado: (2025)
por: Alshatnawi, Amr, et al.
Publicado: (2025)
Knowledge Updating? No More Model Editing! Just Selective Contextual Reasoning
por: He, Guoxiu, et al.
Publicado: (2025)
por: He, Guoxiu, et al.
Publicado: (2025)
ITLC at SemEval-2026 Task 11: Normalization and Deterministic Parsing for Formal Reasoning in LLMs
por: Muhamad, Wicaksono Leksono, et al.
Publicado: (2026)
por: Muhamad, Wicaksono Leksono, et al.
Publicado: (2026)
MTCMB: A Multi-Task Benchmark Framework for Evaluating LLMs on Knowledge, Reasoning, and Safety in Traditional Chinese Medicine
por: Kong, Shufeng, et al.
Publicado: (2025)
por: Kong, Shufeng, et al.
Publicado: (2025)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
por: Shu, Lei, et al.
Publicado: (2023)
por: Shu, Lei, et al.
Publicado: (2023)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
por: Choukrani, Omar, et al.
Publicado: (2025)
por: Choukrani, Omar, et al.
Publicado: (2025)
MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs
por: Zeng, Zhongshen, et al.
Publicado: (2024)
por: Zeng, Zhongshen, et al.
Publicado: (2024)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
por: Hijazi, Faris, et al.
Publicado: (2024)
por: Hijazi, Faris, et al.
Publicado: (2024)
HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning
por: Li, Chance Jiajie, et al.
Publicado: (2025)
por: Li, Chance Jiajie, et al.
Publicado: (2025)
Disentangling Reasoning and Knowledge in Medical Large Language Models
por: Thapa, Rahul, et al.
Publicado: (2025)
por: Thapa, Rahul, et al.
Publicado: (2025)
XplainLLM: A Knowledge-Augmented Dataset for Reliable Grounded Explanations in LLMs
por: Chen, Zichen, et al.
Publicado: (2023)
por: Chen, Zichen, et al.
Publicado: (2023)
Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History
por: Kim, Serin, et al.
Publicado: (2026)
por: Kim, Serin, et al.
Publicado: (2026)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
por: Xu, Hongling, et al.
Publicado: (2025)
por: Xu, Hongling, et al.
Publicado: (2025)
Balancing Knowledge Updates: Toward Unified Modular Editing in LLMs
por: Liu, Jiahao, et al.
Publicado: (2025)
por: Liu, Jiahao, et al.
Publicado: (2025)
Ejemplares similares
-
MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation
por: Bazoge, Adrien
Publicado: (2025) -
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2024) -
Can Hallucinations Help? Boosting LLMs for Drug Discovery
por: Yuan, Shuzhou, et al.
Publicado: (2025) -
Knowledge Graph Structure as Prompt: Improving Small Language Models Capabilities for Knowledge-based Causal Discovery
por: Susanti, Yuni, et al.
Publicado: (2024) -
Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
por: Wang, Qiongqiong, et al.
Publicado: (2025)