Extrinsically-Focused Evaluation of Omissions in Medical Summarization
Fuente:
arXiv
Saved in:
| Main Authors: | Schumacher, Elliot, Rosenthal, Daniel, Naik, Dhruv, Nair, Varun, Price, Luladay, Tso, Geoffrey, Kannan, Anitha |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Rare Disease Differential Diagnosis with Large Language Models at Scale: From Abdominal Actinomycosis to Wilson's Disease
by: Schumacher, Elliot, et al.
Published: (2025)
by: Schumacher, Elliot, et al.
Published: (2025)
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
by: Sun, Albert Yu, et al.
Published: (2023)
by: Sun, Albert Yu, et al.
Published: (2023)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
by: Croxford, Emma, et al.
Published: (2024)
by: Croxford, Emma, et al.
Published: (2024)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
by: Yuan, Dong, et al.
Published: (2024)
by: Yuan, Dong, et al.
Published: (2024)
FocusMed: A Large Language Model-based Framework for Enhancing Medical Question Summarization with Focus Identification
by: Liu, Chao, et al.
Published: (2025)
by: Liu, Chao, et al.
Published: (2025)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
by: Tang, Liyan, et al.
Published: (2024)
by: Tang, Liyan, et al.
Published: (2024)
Generating Query-Focused Summarization Datasets from Query-Free Summarization Datasets
by: Chali, Yllias, et al.
Published: (2026)
by: Chali, Yllias, et al.
Published: (2026)
Enhancing Knowledge Graph Construction: Evaluating with Emphasis on Hallucination, Omission, and Graph Similarity Metrics
by: Ghanem, Hussam, et al.
Published: (2025)
by: Ghanem, Hussam, et al.
Published: (2025)
Context Over Content: Exposing Evaluation Faking in Automated Judges
by: Gupta, Manan, et al.
Published: (2026)
by: Gupta, Manan, et al.
Published: (2026)
Medical Question Summarization with Entity-driven Contrastive Learning
by: Lu, Wenpeng, et al.
Published: (2023)
by: Lu, Wenpeng, et al.
Published: (2023)
Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses
by: Hussain, Khizar, et al.
Published: (2026)
by: Hussain, Khizar, et al.
Published: (2026)
STORYSUMM: Evaluating Faithfulness in Story Summarization
by: Subbiah, Melanie, et al.
Published: (2024)
by: Subbiah, Melanie, et al.
Published: (2024)
TR-EduVSum: A Turkish-Focused Dataset and Consensus Framework for Educational Video Summarization
by: Eğin, Figen, et al.
Published: (2026)
by: Eğin, Figen, et al.
Published: (2026)
Diversity of Thought Improves Reasoning Abilities of LLMs
by: Naik, Ranjita, et al.
Published: (2023)
by: Naik, Ranjita, et al.
Published: (2023)
Medalyze: Lightweight Medical Report Summarization Application Using FLAN-T5-Large
by: Nguyen, Van-Tinh, et al.
Published: (2025)
by: Nguyen, Van-Tinh, et al.
Published: (2025)
Assessment of Transformer-Based Encoder-Decoder Model for Human-Like Summarization
by: Nair, Sindhu, et al.
Published: (2024)
by: Nair, Sindhu, et al.
Published: (2024)
Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology
by: D'Amario, Vanessa, et al.
Published: (2025)
by: D'Amario, Vanessa, et al.
Published: (2025)
Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question Answering
by: Ko, Sungho, et al.
Published: (2024)
by: Ko, Sungho, et al.
Published: (2024)
Leveraging Hierarchical Organization for Medical Multi-document Summarization
by: Hsu, Yi-Li, et al.
Published: (2025)
by: Hsu, Yi-Li, et al.
Published: (2025)
$\texttt{COSMIC}$: Mutual Information for Task-Agnostic Summarization Evaluation
by: Darrin, Maxime, et al.
Published: (2024)
by: Darrin, Maxime, et al.
Published: (2024)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
by: Liu, Yinhong, et al.
Published: (2025)
by: Liu, Yinhong, et al.
Published: (2025)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
by: Jin, Keyan, et al.
Published: (2025)
by: Jin, Keyan, et al.
Published: (2025)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
by: Zhang, Shiyue, et al.
Published: (2024)
by: Zhang, Shiyue, et al.
Published: (2024)
A Comparative Study of Quality Evaluation Methods for Text Summarization
by: Nguyen, Huyen, et al.
Published: (2024)
by: Nguyen, Huyen, et al.
Published: (2024)
MEDSAGE: Enhancing Robustness of Medical Dialogue Summarization to ASR Errors with LLM-generated Synthetic Dialogues
by: Binici, Kuluhan, et al.
Published: (2024)
by: Binici, Kuluhan, et al.
Published: (2024)
Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
by: Saraogi, Devesh, et al.
Published: (2025)
by: Saraogi, Devesh, et al.
Published: (2025)
PreSumm: Predicting Summarization Performance Without Summarizing
by: Koniaev, Steven, et al.
Published: (2025)
by: Koniaev, Steven, et al.
Published: (2025)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
by: Zhong, Yang, et al.
Published: (2025)
by: Zhong, Yang, et al.
Published: (2025)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
by: Yang, Xinqi, et al.
Published: (2024)
by: Yang, Xinqi, et al.
Published: (2024)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
by: Pang, Tsz Fung, et al.
Published: (2025)
by: Pang, Tsz Fung, et al.
Published: (2025)
SEval-Ex: A Statement-Level Framework for Explainable Summarization Evaluation
by: Herserant, Tanguy, et al.
Published: (2025)
by: Herserant, Tanguy, et al.
Published: (2025)
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
by: Min, Hyangsuk, et al.
Published: (2025)
by: Min, Hyangsuk, et al.
Published: (2025)
FineSurE: Fine-grained Summarization Evaluation using LLMs
by: Song, Hwanjun, et al.
Published: (2024)
by: Song, Hwanjun, et al.
Published: (2024)
Policies and Evaluation for Online Meeting Summarization
by: Schneider, Felix, et al.
Published: (2025)
by: Schneider, Felix, et al.
Published: (2025)
FG-RAG: Enhancing Query-Focused Summarization with Context-Aware Fine-Grained Graph RAG
by: Hong, Yubin, et al.
Published: (2025)
by: Hong, Yubin, et al.
Published: (2025)
Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies
by: Rathore, Charan Prakash, et al.
Published: (2025)
by: Rathore, Charan Prakash, et al.
Published: (2025)
Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance
by: Xu, Borui, et al.
Published: (2025)
by: Xu, Borui, et al.
Published: (2025)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
by: Aly, Walid Mohamed, et al.
Published: (2025)
by: Aly, Walid Mohamed, et al.
Published: (2025)
CRScore: Grounding Automated Evaluation of Code Review Comments in Code Claims and Smells
by: Naik, Atharva, et al.
Published: (2024)
by: Naik, Atharva, et al.
Published: (2024)
Evaluating Large Language Models for Real-World Engineering Tasks
by: Heesch, Rene, et al.
Published: (2025)
by: Heesch, Rene, et al.
Published: (2025)
Similar Items
-
Rare Disease Differential Diagnosis with Large Language Models at Scale: From Abdominal Actinomycosis to Wilson's Disease
by: Schumacher, Elliot, et al.
Published: (2025) -
CONSCENDI: A Contrastive and Scenario-Guided Distillation Approach to Guardrail Models for Virtual Assistants
by: Sun, Albert Yu, et al.
Published: (2023) -
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
by: Croxford, Emma, et al.
Published: (2024) -
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
by: Yuan, Dong, et al.
Published: (2024) -
FocusMed: A Large Language Model-based Framework for Enhancing Medical Question Summarization with Focus Identification
by: Liu, Chao, et al.
Published: (2025)