ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgment
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Ruochen, Li, Jun, Jian, Bailiang, Yuan, Kun, Zhu, Youxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability
di: Li, Ruochen, et al.
Pubblicazione: (2026)
di: Li, Ruochen, et al.
Pubblicazione: (2026)
Focus Directions Make Your Language Models Pay More Attention to Relevant Contexts
di: Zhu, Youxiang, et al.
Pubblicazione: (2025)
di: Zhu, Youxiang, et al.
Pubblicazione: (2025)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
di: Zhang, Xiechi, et al.
Pubblicazione: (2025)
di: Zhang, Xiechi, et al.
Pubblicazione: (2025)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
di: Jin, Haoan, et al.
Pubblicazione: (2025)
di: Jin, Haoan, et al.
Pubblicazione: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
di: Grolleau, François, et al.
Pubblicazione: (2025)
di: Grolleau, François, et al.
Pubblicazione: (2025)
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
di: Cho, Yousang, et al.
Pubblicazione: (2025)
di: Cho, Yousang, et al.
Pubblicazione: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
di: Mao, Kangkun, et al.
Pubblicazione: (2025)
di: Mao, Kangkun, et al.
Pubblicazione: (2025)
ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World
di: Yan, Weixiang, et al.
Pubblicazione: (2024)
di: Yan, Weixiang, et al.
Pubblicazione: (2024)
MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings
di: Corbeil, Jean-Philippe, et al.
Pubblicazione: (2025)
di: Corbeil, Jean-Philippe, et al.
Pubblicazione: (2025)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
di: Zhang, Ming, et al.
Pubblicazione: (2025)
di: Zhang, Ming, et al.
Pubblicazione: (2025)
CFMatch: Aligning Automated Answer Equivalence Evaluation with Expert Judgments For Open-Domain Question Answering
di: Li, Zongxia, et al.
Pubblicazione: (2024)
di: Li, Zongxia, et al.
Pubblicazione: (2024)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation
di: Maye-Lasserre, Tom, et al.
Pubblicazione: (2026)
di: Maye-Lasserre, Tom, et al.
Pubblicazione: (2026)
FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback
di: Chu, Seongyeub, et al.
Pubblicazione: (2026)
di: Chu, Seongyeub, et al.
Pubblicazione: (2026)
Reasons to Reject? Aligning Language Models with Judgments
di: Xu, Weiwen, et al.
Pubblicazione: (2023)
di: Xu, Weiwen, et al.
Pubblicazione: (2023)
EvalCards: A Framework for Standardized Evaluation Reporting
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field
di: Bonzi, Doria, et al.
Pubblicazione: (2025)
di: Bonzi, Doria, et al.
Pubblicazione: (2025)
BatchEval: Towards Human-like Text Evaluation
di: Yuan, Peiwen, et al.
Pubblicazione: (2023)
di: Yuan, Peiwen, et al.
Pubblicazione: (2023)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
di: Wu, Yao, et al.
Pubblicazione: (2026)
di: Wu, Yao, et al.
Pubblicazione: (2026)
AlphaEval: Evaluating Agents in Production
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
UMB@PerAnsSumm 2025: Enhancing Perspective-Aware Summarization with Prompt Optimization and Supervised Fine-Tuning
di: Qi, Kristin, et al.
Pubblicazione: (2025)
di: Qi, Kristin, et al.
Pubblicazione: (2025)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
di: Shang, Fangxin, et al.
Pubblicazione: (2025)
di: Shang, Fangxin, et al.
Pubblicazione: (2025)
MRG-R1: Reinforcement Learning for Clinically Aligned Medical Report Generation
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
di: Wang, Pengyu, et al.
Pubblicazione: (2025)
Aligning Query Representation with Rewritten Query and Relevance Judgments in Conversational Search
di: Mo, Fengran, et al.
Pubblicazione: (2024)
di: Mo, Fengran, et al.
Pubblicazione: (2024)
Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
di: Li, Dubai, et al.
Pubblicazione: (2026)
di: Li, Dubai, et al.
Pubblicazione: (2026)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
di: Liu, Yuxuan, et al.
Pubblicazione: (2024)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
ReMedi: Reasoner for Medical Clinical Prediction
di: Cao, Yushi, et al.
Pubblicazione: (2026)
di: Cao, Yushi, et al.
Pubblicazione: (2026)
MultifacetEval: Multifaceted Evaluation to Probe LLMs in Mastering Medical Knowledge
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
di: Veysi, Marjan, et al.
Pubblicazione: (2026)
di: Veysi, Marjan, et al.
Pubblicazione: (2026)
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
di: Zhu, Siyu, et al.
Pubblicazione: (2025)
di: Zhu, Siyu, et al.
Pubblicazione: (2025)
Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery
di: Jiang, Yifan, et al.
Pubblicazione: (2026)
di: Jiang, Yifan, et al.
Pubblicazione: (2026)
MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring
di: Wang, Qipeng, et al.
Pubblicazione: (2025)
di: Wang, Qipeng, et al.
Pubblicazione: (2025)
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
Fact or Guesswork? Evaluating Large Language Models' Medical Knowledge with Structured One-Hop Judgments
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning
di: Yin, Joy Lim Jia, et al.
Pubblicazione: (2025)
di: Yin, Joy Lim Jia, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability
di: Li, Ruochen, et al.
Pubblicazione: (2026) -
Focus Directions Make Your Language Models Pay More Attention to Relevant Contexts
di: Zhu, Youxiang, et al.
Pubblicazione: (2025) -
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
di: Zhang, Xiechi, et al.
Pubblicazione: (2025) -
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
di: Jin, Haoan, et al.
Pubblicazione: (2025) -
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)