Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Yuan, Dong, Rastogi, Eti, Zhao, Fen, Goyal, Sagar, Naik, Gautam, Rajagopal, Sree Prasanna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Continued Pretrained LLM Approach for Automatic Medical Note Generation
di: Yuan, Dong, et al.
Pubblicazione: (2024)
di: Yuan, Dong, et al.
Pubblicazione: (2024)
Extrinsically-Focused Evaluation of Omissions in Medical Summarization
di: Schumacher, Elliot, et al.
Pubblicazione: (2023)
di: Schumacher, Elliot, et al.
Pubblicazione: (2023)
FineSurE: Fine-grained Summarization Evaluation using LLMs
di: Song, Hwanjun, et al.
Pubblicazione: (2024)
di: Song, Hwanjun, et al.
Pubblicazione: (2024)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
di: Zhang, Shiyue, et al.
Pubblicazione: (2024)
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
di: Min, Hyangsuk, et al.
Pubblicazione: (2025)
di: Min, Hyangsuk, et al.
Pubblicazione: (2025)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
di: Lee, Yuho, et al.
Pubblicazione: (2024)
di: Lee, Yuho, et al.
Pubblicazione: (2024)
STORYSUMM: Evaluating Faithfulness in Story Summarization
di: Subbiah, Melanie, et al.
Pubblicazione: (2024)
di: Subbiah, Melanie, et al.
Pubblicazione: (2024)
Abstractive Summarization of Low resourced Nepali language using Multilingual Transformers
di: Dhakal, Prakash, et al.
Pubblicazione: (2024)
di: Dhakal, Prakash, et al.
Pubblicazione: (2024)
ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization
di: Bae, Suyoung, et al.
Pubblicazione: (2026)
di: Bae, Suyoung, et al.
Pubblicazione: (2026)
LMUnit: Fine-grained Evaluation with Natural Language Unit Tests
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
di: Saad-Falcon, Jon, et al.
Pubblicazione: (2024)
Auto-ARGUE: LLM-Based Report Generation Evaluation
di: Walden, William, et al.
Pubblicazione: (2025)
di: Walden, William, et al.
Pubblicazione: (2025)
ByteScience: Bridging Unstructured Scientific Literature and Structured Data with Auto Fine-tuned Large Language Model in Token Granularity
di: Xie, Tong, et al.
Pubblicazione: (2024)
di: Xie, Tong, et al.
Pubblicazione: (2024)
AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data
di: Wu, JiaRu, et al.
Pubblicazione: (2025)
di: Wu, JiaRu, et al.
Pubblicazione: (2025)
SciQAG: A Framework for Auto-Generated Science Question Answering Dataset with Fine-grained Evaluation
di: Wan, Yuwei, et al.
Pubblicazione: (2024)
di: Wan, Yuwei, et al.
Pubblicazione: (2024)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
di: Tang, Liyan, et al.
Pubblicazione: (2024)
di: Tang, Liyan, et al.
Pubblicazione: (2024)
$\texttt{COSMIC}$: Mutual Information for Task-Agnostic Summarization Evaluation
di: Darrin, Maxime, et al.
Pubblicazione: (2024)
di: Darrin, Maxime, et al.
Pubblicazione: (2024)
A Comparative Study of Quality Evaluation Methods for Text Summarization
di: Nguyen, Huyen, et al.
Pubblicazione: (2024)
di: Nguyen, Huyen, et al.
Pubblicazione: (2024)
MDSEval: A Meta-Evaluation Benchmark for Multimodal Dialogue Summarization
di: Liu, Yinhong, et al.
Pubblicazione: (2025)
di: Liu, Yinhong, et al.
Pubblicazione: (2025)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
di: Jin, Keyan, et al.
Pubblicazione: (2025)
di: Jin, Keyan, et al.
Pubblicazione: (2025)
Policies and Evaluation for Online Meeting Summarization
di: Schneider, Felix, et al.
Pubblicazione: (2025)
di: Schneider, Felix, et al.
Pubblicazione: (2025)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
Discourse-Driven Evaluation: Unveiling Factual Inconsistency in Long Document Summarization
di: Zhong, Yang, et al.
Pubblicazione: (2025)
di: Zhong, Yang, et al.
Pubblicazione: (2025)
PersonaMatrix: A Recipe for Persona-Aware Evaluation of Legal Summarization
di: Pang, Tsz Fung, et al.
Pubblicazione: (2025)
di: Pang, Tsz Fung, et al.
Pubblicazione: (2025)
SEval-Ex: A Statement-Level Framework for Explainable Summarization Evaluation
di: Herserant, Tanguy, et al.
Pubblicazione: (2025)
di: Herserant, Tanguy, et al.
Pubblicazione: (2025)
Prompt Sentiment: The Catalyst for LLM Change
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
Leveraging the Power of LLMs: A Fine-Tuning Approach for High-Quality Aspect-Based Summarization
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
Evaluating Small Language Models for News Summarization: Implications and Factors Influencing Performance
di: Xu, Borui, et al.
Pubblicazione: (2025)
di: Xu, Borui, et al.
Pubblicazione: (2025)
AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators
di: Ryan, Michael J., et al.
Pubblicazione: (2025)
di: Ryan, Michael J., et al.
Pubblicazione: (2025)
Fine-Tuned Language Models for Domain-Specific Summarization and Tagging
di: Wang, Jun, et al.
Pubblicazione: (2025)
di: Wang, Jun, et al.
Pubblicazione: (2025)
Learning to Summarize from LLM-generated Feedback
di: Song, Hwanjun, et al.
Pubblicazione: (2024)
di: Song, Hwanjun, et al.
Pubblicazione: (2024)
TALEC: Teach Your LLM to Evaluate in Specific Domain with In-house Criteria by Criteria Division and Zero-shot Plus Few-shot
di: Zhang, Kaiqi, et al.
Pubblicazione: (2024)
di: Zhang, Kaiqi, et al.
Pubblicazione: (2024)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
di: Croxford, Emma, et al.
Pubblicazione: (2024)
di: Croxford, Emma, et al.
Pubblicazione: (2024)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
di: Aly, Walid Mohamed, et al.
Pubblicazione: (2025)
di: Aly, Walid Mohamed, et al.
Pubblicazione: (2025)
CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models
di: Kalyan, Pavan, et al.
Pubblicazione: (2025)
di: Kalyan, Pavan, et al.
Pubblicazione: (2025)
LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
AutoMix: Automatically Mixing Language Models
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2023)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2023)
Towards Coarse-to-Fine Evaluation of Inference Efficiency for Large Language Models
di: Chen, Yushuo, et al.
Pubblicazione: (2024)
di: Chen, Yushuo, et al.
Pubblicazione: (2024)
ReFeR: Improving Evaluation and Reasoning through Hierarchy of Models
di: Narsupalli, Yaswanth, et al.
Pubblicazione: (2024)
di: Narsupalli, Yaswanth, et al.
Pubblicazione: (2024)
Prompt Recursive Search: A Living Framework with Adaptive Growth in LLM Auto-Prompting
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Continued Pretrained LLM Approach for Automatic Medical Note Generation
di: Yuan, Dong, et al.
Pubblicazione: (2024) -
Extrinsically-Focused Evaluation of Omissions in Medical Summarization
di: Schumacher, Elliot, et al.
Pubblicazione: (2023) -
FineSurE: Fine-grained Summarization Evaluation using LLMs
di: Song, Hwanjun, et al.
Pubblicazione: (2024) -
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
di: Zhang, Shiyue, et al.
Pubblicazione: (2024) -
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
di: Min, Hyangsuk, et al.
Pubblicazione: (2025)