Assessing the Quality of AI-Generated Clinical Notes: A Validated Evaluation of a Large Language Model Scribe
Fuente:
arXiv
Saved in:
| Main Authors: | Palm, Erin, Manikantan, Astrit, Pepin, Mark E., Mahal, Herprit, Belwadi, Srikanth Subramanya |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
by: Krolik, Jack, et al.
Published: (2024)
by: Krolik, Jack, et al.
Published: (2024)
Replicating ReLM Results: Validating Large Language Models with ReLM
by: Adamson, Reece, et al.
Published: (2025)
by: Adamson, Reece, et al.
Published: (2025)
Evaluation of Clinical Trials Reporting Quality using Large Language Models
by: Laï-king, Mathieu, et al.
Published: (2025)
by: Laï-king, Mathieu, et al.
Published: (2025)
Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
by: Rahman, Salman, et al.
Published: (2024)
by: Rahman, Salman, et al.
Published: (2024)
ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical Notes
by: Yang, Zhichao, et al.
Published: (2024)
by: Yang, Zhichao, et al.
Published: (2024)
From Feedback to Checklists: Grounded Evaluation of AI-Generated Clinical Notes
by: Zhou, Karen, et al.
Published: (2025)
by: Zhou, Karen, et al.
Published: (2025)
COPAL: Continual Pruning in Large Language Generative Models
by: Malla, Srikanth, et al.
Published: (2024)
by: Malla, Srikanth, et al.
Published: (2024)
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
by: Liu, Jinghui, et al.
Published: (2026)
by: Liu, Jinghui, et al.
Published: (2026)
Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes
by: Kweon, Sunjun, et al.
Published: (2023)
by: Kweon, Sunjun, et al.
Published: (2023)
Evaluation of General Large Language Models in Contextually Assessing Semantic Concepts Extracted from Adult Critical Care Electronic Health Record Notes
by: Liu, Darren, et al.
Published: (2024)
by: Liu, Darren, et al.
Published: (2024)
A Multi-agent Large Language Model Framework to Automatically Assess Performance of a Clinical AI Triage Tool
by: Flanders, Adam E., et al.
Published: (2025)
by: Flanders, Adam E., et al.
Published: (2025)
Assessing Political Bias in Large Language Models
by: Rettenberger, Luca, et al.
Published: (2024)
by: Rettenberger, Luca, et al.
Published: (2024)
Information Extraction from Clinical Notes: Are We Ready to Switch to Large Language Models?
by: Hu, Yan, et al.
Published: (2024)
by: Hu, Yan, et al.
Published: (2024)
A Comprehensive Survey of Accelerated Generation Techniques in Large Language Models
by: Khoshnoodi, Mahsa, et al.
Published: (2024)
by: Khoshnoodi, Mahsa, et al.
Published: (2024)
Towards Adapting Open-Source Large Language Models for Expert-Level Clinical Note Generation
by: Wang, Hanyin, et al.
Published: (2024)
by: Wang, Hanyin, et al.
Published: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
by: Kammakomati, Mehant, et al.
Published: (2024)
by: Kammakomati, Mehant, et al.
Published: (2024)
DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries
by: Boll, Heloisa Oss, et al.
Published: (2025)
by: Boll, Heloisa Oss, et al.
Published: (2025)
Contradiction Detection in RAG Systems: Evaluating LLMs as Context Validators for Improved Information Consistency
by: Gokul, Vignesh, et al.
Published: (2025)
by: Gokul, Vignesh, et al.
Published: (2025)
LEME: Open Large Language Models for Ophthalmology with Advanced Reasoning and Clinical Validation
by: Kim, Hyunjae, et al.
Published: (2024)
by: Kim, Hyunjae, et al.
Published: (2024)
Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI
by: Saha, Agnik, et al.
Published: (2025)
by: Saha, Agnik, et al.
Published: (2025)
Efficient Standardization of Clinical Notes using Large Language Models
by: Hier, Daniel B., et al.
Published: (2024)
by: Hier, Daniel B., et al.
Published: (2024)
Comparing Two Model Designs for Clinical Note Generation; Is an LLM a Useful Evaluator of Consistency?
by: Brake, Nathan, et al.
Published: (2024)
by: Brake, Nathan, et al.
Published: (2024)
DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models
by: Wang, Bowen, et al.
Published: (2024)
by: Wang, Bowen, et al.
Published: (2024)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
by: Li, Zheqing, et al.
Published: (2025)
by: Li, Zheqing, et al.
Published: (2025)
Mining Clinical Notes for Physical Rehabilitation Exercise Information: Natural Language Processing Algorithm Development and Validation Study
by: Sivarajkumar, Sonish, et al.
Published: (2023)
by: Sivarajkumar, Sonish, et al.
Published: (2023)
A Large Language Model Based Pipeline for Review of Systems Entity Recognition from Clinical Notes
by: Nghiem, Hieu, et al.
Published: (2025)
by: Nghiem, Hieu, et al.
Published: (2025)
Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation
by: Adib, Shefayat E Shams, et al.
Published: (2026)
by: Adib, Shefayat E Shams, et al.
Published: (2026)
Assessing Personalized AI Mentoring with Large Language Models in the Computing Field
by: Luo, Xiao, et al.
Published: (2024)
by: Luo, Xiao, et al.
Published: (2024)
Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language Models
by: Xu, Ran, et al.
Published: (2023)
by: Xu, Ran, et al.
Published: (2023)
Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Language Models
by: Koo, Heejoon
Published: (2025)
by: Koo, Heejoon
Published: (2025)
Divergent Creativity in Humans and Large Language Models
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models
by: Yuan, Yefeng, et al.
Published: (2024)
by: Yuan, Yefeng, et al.
Published: (2024)
Assessing the Role of Data Quality in Training Bilingual Language Models
by: Seto, Skyler, et al.
Published: (2025)
by: Seto, Skyler, et al.
Published: (2025)
Evaluating Large Language Models for Evidence-Based Clinical Question Answering
by: Wang, Can, et al.
Published: (2025)
by: Wang, Can, et al.
Published: (2025)
Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models
by: Tsintsiper, Isabel, et al.
Published: (2026)
by: Tsintsiper, Isabel, et al.
Published: (2026)
Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III
by: Shetty, Pranam, et al.
Published: (2025)
by: Shetty, Pranam, et al.
Published: (2025)
The Foundational Capabilities of Large Language Models in Predicting Postoperative Risks Using Clinical Notes
by: Alba, Charles, et al.
Published: (2024)
by: Alba, Charles, et al.
Published: (2024)
RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)
by: Wei, Yishu, et al.
Published: (2026)
by: Wei, Yishu, et al.
Published: (2026)
MedSlice: Fine-Tuned Large Language Models for Secure Clinical Note Sectioning
by: Davis, Joshua, et al.
Published: (2025)
by: Davis, Joshua, et al.
Published: (2025)
WaterJudge: Quality-Detection Trade-off when Watermarking Large Language Models
by: Molenda, Piotr, et al.
Published: (2024)
by: Molenda, Piotr, et al.
Published: (2024)
Similar Items
-
Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation
by: Krolik, Jack, et al.
Published: (2024) -
Replicating ReLM Results: Validating Large Language Models with ReLM
by: Adamson, Reece, et al.
Published: (2025) -
Evaluation of Clinical Trials Reporting Quality using Large Language Models
by: Laï-king, Mathieu, et al.
Published: (2025) -
Generalization in Healthcare AI: Evaluation of a Clinical Large Language Model
by: Rahman, Salman, et al.
Published: (2024) -
ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical Notes
by: Yang, Zhichao, et al.
Published: (2024)