Comparing Two Model Designs for Clinical Note Generation; Is an LLM a Useful Evaluator of Consistency?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Brake, Nathan, Schaaf, Thomas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Personalized Clinical Note Generation from Doctor-Patient Conversations
par: Brake, Nathan, et autres
Publié: (2024)
par: Brake, Nathan, et autres
Publié: (2024)
DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries
par: Boll, Heloisa Oss, et autres
Publié: (2025)
par: Boll, Heloisa Oss, et autres
Publié: (2025)
A Survey of Useful LLM Evaluation
par: Peng, Ji-Lun, et autres
Publié: (2024)
par: Peng, Ji-Lun, et autres
Publié: (2024)
Evaluating the Consistency of LLM Evaluators
par: Lee, Noah, et autres
Publié: (2024)
par: Lee, Noah, et autres
Publié: (2024)
ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical Notes
par: Yang, Zhichao, et autres
Publié: (2024)
par: Yang, Zhichao, et autres
Publié: (2024)
Are Checklists Really Useful for Automatic Evaluation of Generative Tasks?
par: Furuhashi, Momoka, et autres
Publié: (2025)
par: Furuhashi, Momoka, et autres
Publié: (2025)
Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids
par: Lukassen, Fabian, et autres
Publié: (2026)
par: Lukassen, Fabian, et autres
Publié: (2026)
Differentially Private De-identification of Dutch Clinical Notes: A Comparative Evaluation
par: Miranda, Michele, et autres
Publié: (2026)
par: Miranda, Michele, et autres
Publié: (2026)
From Feedback to Checklists: Grounded Evaluation of AI-Generated Clinical Notes
par: Zhou, Karen, et autres
Publié: (2025)
par: Zhou, Karen, et autres
Publié: (2025)
ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities
par: Hong, Zhaochen, et autres
Publié: (2025)
par: Hong, Zhaochen, et autres
Publié: (2025)
Clinical Note Bloat Reduction for Efficient LLM Use
par: Cahoon, Jordan L., et autres
Publié: (2026)
par: Cahoon, Jordan L., et autres
Publié: (2026)
Assessing the Quality of AI-Generated Clinical Notes: A Validated Evaluation of a Large Language Model Scribe
par: Palm, Erin, et autres
Publié: (2025)
par: Palm, Erin, et autres
Publié: (2025)
Enhancing Clinical Efficiency through LLM: Discharge Note Generation for Cardiac Patients
par: Jung, HyoJe, et autres
Publié: (2024)
par: Jung, HyoJe, et autres
Publié: (2024)
Improving Clinical Note Generation from Complex Doctor-Patient Conversation
par: Li, Yizhan, et autres
Publié: (2024)
par: Li, Yizhan, et autres
Publié: (2024)
Synthetic Patient-Physician Dialogue Generation from Clinical Notes Using LLM
par: Das, Trisha, et autres
Publié: (2024)
par: Das, Trisha, et autres
Publié: (2024)
From Generative Modeling to Clinical Classification: A GPT-Based Architecture for EHR Notes
par: Irany, Fariba Afrin, et autres
Publié: (2026)
par: Irany, Fariba Afrin, et autres
Publié: (2026)
What Makes LLM Agent Simulations Useful for Policy Practice? An Iterative Design Study in Emergency Preparedness
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale
par: Liu, Jinghui, et autres
Publié: (2026)
par: Liu, Jinghui, et autres
Publié: (2026)
Poor-Supervised Evaluation for SuperLLM via Mutual Consistency
par: Yuan, Peiwen, et autres
Publié: (2024)
par: Yuan, Peiwen, et autres
Publié: (2024)
FactEHR: A Dataset for Evaluating Factuality in Clinical Notes Using LLMs
par: Munnangi, Monica, et autres
Publié: (2024)
par: Munnangi, Monica, et autres
Publié: (2024)
CNSight: Evaluation of Clinical Note Segmentation Tools
par: Surana, Risha, et autres
Publié: (2025)
par: Surana, Risha, et autres
Publié: (2025)
Noise or Nuance: An Investigation Into Useful Information and Filtering For LLM Driven AKBC
par: Clay, Alex, et autres
Publié: (2025)
par: Clay, Alex, et autres
Publié: (2025)
Controllable Synthetic Clinical Note Generation with Privacy Guarantees
par: Baumel, Tal, et autres
Publié: (2024)
par: Baumel, Tal, et autres
Publié: (2024)
Found in Translation: Measuring Multilingual LLM Consistency as Simple as Translate then Evaluate
par: Gupta, Ashim, et autres
Publié: (2025)
par: Gupta, Ashim, et autres
Publié: (2025)
An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation
par: Mahapatra, Joy, et autres
Publié: (2024)
par: Mahapatra, Joy, et autres
Publié: (2024)
LLM Sensitivity Evaluation Framework for Clinical Diagnosis
par: Yan, Chenwei, et autres
Publié: (2025)
par: Yan, Chenwei, et autres
Publié: (2025)
LLM-Based Data Generation and Clinical Skills Evaluation for Low-Resource French OSCEs
par: Huang, Tian, et autres
Publié: (2026)
par: Huang, Tian, et autres
Publié: (2026)
Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties
par: Faisal, Fahim, et autres
Publié: (2024)
par: Faisal, Fahim, et autres
Publié: (2024)
Extracting Social Support and Social Isolation Information from Clinical Psychiatry Notes: Comparing a Rule-based NLP System and a Large Language Model
par: Patra, Braja Gopal, et autres
Publié: (2024)
par: Patra, Braja Gopal, et autres
Publié: (2024)
Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise
par: Wang, Hanyin, et autres
Publié: (2024)
par: Wang, Hanyin, et autres
Publié: (2024)
Evaluating Spatiotemporal Consistency in Automatically Generated Sewing Instructions
par: Geiger, Luisa, et autres
Publié: (2025)
par: Geiger, Luisa, et autres
Publié: (2025)
Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
par: Zhang, Qiyuan, et autres
Publié: (2025)
par: Zhang, Qiyuan, et autres
Publié: (2025)
A Large Language Model Based Pipeline for Review of Systems Entity Recognition from Clinical Notes
par: Nghiem, Hieu, et autres
Publié: (2025)
par: Nghiem, Hieu, et autres
Publié: (2025)
Benchmarking of LLM Detection: Comparing Two Competing Approaches
par: Pröhl, Thorsten, et autres
Publié: (2024)
par: Pröhl, Thorsten, et autres
Publié: (2024)
Useful Evaluation: Syntax and Semantics (Technical Report)
par: Barenbaum, Pablo, et autres
Publié: (2024)
par: Barenbaum, Pablo, et autres
Publié: (2024)
Extracting Breast Cancer Phenotypes from Clinical Notes: Comparing LLMs with Classical Ontology Methods
par: Faiz, Abdullah Bin, et autres
Publié: (2026)
par: Faiz, Abdullah Bin, et autres
Publié: (2026)
Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes
par: Kweon, Sunjun, et autres
Publié: (2023)
par: Kweon, Sunjun, et autres
Publié: (2023)
When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation
par: Faisal, Faizan
Publié: (2026)
par: Faisal, Faizan
Publié: (2026)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025)
par: Villa, Danielle, et autres
Publié: (2025)
Term2Note: Synthesising Differentially Private Clinical Notes from Medical Terms
par: Wu, Yuping, et autres
Publié: (2025)
par: Wu, Yuping, et autres
Publié: (2025)
Documents similaires
-
Personalized Clinical Note Generation from Doctor-Patient Conversations
par: Brake, Nathan, et autres
Publié: (2024) -
DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries
par: Boll, Heloisa Oss, et autres
Publié: (2025) -
A Survey of Useful LLM Evaluation
par: Peng, Ji-Lun, et autres
Publié: (2024) -
Evaluating the Consistency of LLM Evaluators
par: Lee, Noah, et autres
Publié: (2024) -
ClinicalMamba: A Generative Clinical Language Model on Longitudinal Clinical Notes
par: Yang, Zhichao, et autres
Publié: (2024)