MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
Fuente:
arXiv
Saved in:
| Main Authors: | Grolleau, François, Alsentzer, Emily, Keyes, Timothy, Chung, Philip, Swaminathan, Akshay, Aali, Asad, Hom, Jason, Huynh, Tridu, Lew, Thomas, Liang, April S., Chu, Weihan, Steele, Natasha Z., Lin, Christina F., Yang, Jingkun, Black, Kameron C., Ma, Stephen P., Haredasht, Fateme N., Shah, Nigam H., Schulman, Kevin, Chen, Jonathan H. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Retrieval-Augmented Guardrails for AI-Drafted Patient-Portal Messages: Error Taxonomy Construction and Large-Scale Evaluation
by: Chen, Wenyuan, et al.
Published: (2025)
by: Chen, Wenyuan, et al.
Published: (2025)
MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
by: Jiang, Yixing, et al.
Published: (2025)
by: Jiang, Yixing, et al.
Published: (2025)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
by: Bedi, Suhana, et al.
Published: (2025)
by: Bedi, Suhana, et al.
Published: (2025)
MedVAL: Toward Expert-Level Medical Text Validation with Language Models
by: Aali, Asad, et al.
Published: (2025)
by: Aali, Asad, et al.
Published: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
Deployment and Evaluation of an EHR-integrated, Large Language Model-Powered Tool to Triage Surgical Patients
by: Wang, Jane, et al.
Published: (2026)
by: Wang, Jane, et al.
Published: (2026)
Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models
by: Ronaghi, Sasha, et al.
Published: (2026)
by: Ronaghi, Sasha, et al.
Published: (2026)
MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare
by: Nigam, Shubham Kumar, et al.
Published: (2026)
by: Nigam, Shubham Kumar, et al.
Published: (2026)
Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages
by: Anyaegbuna, Chukwuebuka, et al.
Published: (2026)
by: Anyaegbuna, Chukwuebuka, et al.
Published: (2026)
Embedding-Driven Diversity Sampling to Improve Few-Shot Synthetic Data Generation
by: Lopez, Ivan, et al.
Published: (2025)
by: Lopez, Ivan, et al.
Published: (2025)
Clinical Note Bloat Reduction for Efficient LLM Use
by: Cahoon, Jordan L., et al.
Published: (2026)
by: Cahoon, Jordan L., et al.
Published: (2026)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
by: Yue, Jingkun, et al.
Published: (2025)
by: Yue, Jingkun, et al.
Published: (2025)
IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
by: Nigam, Shubham Kumar, et al.
Published: (2026)
by: Nigam, Shubham Kumar, et al.
Published: (2026)
Splitwiser: Efficient LM inference with constrained resources
by: Aali, Asad, et al.
Published: (2025)
by: Aali, Asad, et al.
Published: (2025)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
by: Wu, Juncheng, et al.
Published: (2025)
by: Wu, Juncheng, et al.
Published: (2025)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
by: Zhang, Xiechi, et al.
Published: (2025)
by: Zhang, Xiechi, et al.
Published: (2025)
CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field
by: Bonzi, Doria, et al.
Published: (2025)
by: Bonzi, Doria, et al.
Published: (2025)
MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences
by: Wu, Eric, et al.
Published: (2026)
by: Wu, Eric, et al.
Published: (2026)
MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation
by: Li, Gengliang, et al.
Published: (2025)
by: Li, Gengliang, et al.
Published: (2025)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2025)
by: Jin, Haoan, et al.
Published: (2025)
MedEst
Published: (2024)
Published: (2024)
MedUNAB
Published: (2018)
Published: (2018)
BioMed
Published: (2023)
Published: (2023)
Med Research
Published: (2026)
Published: (2026)
LabMed
Published: (2026)
Published: (2026)
MedComm
Published: (2020)
Published: (2020)
JMIRx Med
Published: (2022)
Published: (2022)
MedMat
Published: (2025)
Published: (2025)
MedSAE: Dissecting MedCLIP Representations with Sparse Autoencoders
by: Renzulli, Riccardo, et al.
Published: (2025)
by: Renzulli, Riccardo, et al.
Published: (2025)
MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models
by: Royer, Corentin, et al.
Published: (2024)
by: Royer, Corentin, et al.
Published: (2024)
Quantization-aware Matrix Factorization for Low Bit Rate Image Compression
by: Ashtari, Pooya, et al.
Published: (2024)
by: Ashtari, Pooya, et al.
Published: (2024)
MedIQA: A Scalable Foundation Model for Prompt-Driven Medical Image Quality Assessment
by: Xun, Siyi, et al.
Published: (2025)
by: Xun, Siyi, et al.
Published: (2025)
MedCore: Boundary-Preserving Medical Core Pruning for MedSAM
by: Zhang, Cenwei, et al.
Published: (2026)
by: Zhang, Cenwei, et al.
Published: (2026)
MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification
by: Huang, Heyuan, et al.
Published: (2025)
by: Huang, Heyuan, et al.
Published: (2025)
Compositional Neuro-Symbolic Reasoning
by: Das, Anugyan, et al.
Published: (2026)
by: Das, Anugyan, et al.
Published: (2026)
ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgment
by: Li, Ruochen, et al.
Published: (2025)
by: Li, Ruochen, et al.
Published: (2025)
Similar Items
-
Retrieval-Augmented Guardrails for AI-Drafted Patient-Portal Messages: Error Taxonomy Construction and Large-Scale Evaluation
by: Chen, Wenyuan, et al.
Published: (2025) -
MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
by: Jiang, Yixing, et al.
Published: (2025) -
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
by: Bedi, Suhana, et al.
Published: (2025) -
MedVAL: Toward Expert-Level Medical Text Validation with Language Models
by: Aali, Asad, et al.
Published: (2025) -
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)