APPLS: Evaluating Evaluation Metrics for Plain Language Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Yue, August, Tal, Leroy, Gondy, Cohen, Trevor, Wang, Lucy Lu |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Are LLM-generated plain language summaries truly understandable? A large-scale crowdsourced evaluation
par: Guo, Yue, et autres
Publié: (2025)
par: Guo, Yue, et autres
Publié: (2025)
Retrieval augmentation of large language models for lay language generation
par: Guo, Yue, et autres
Publié: (2022)
par: Guo, Yue, et autres
Publié: (2022)
PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization
par: You, Zhiwen, et autres
Publié: (2025)
par: You, Zhiwen, et autres
Publié: (2025)
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
par: Lucy, Li, et autres
Publié: (2024)
par: Lucy, Li, et autres
Publié: (2024)
FactPICO: Factuality Evaluation for Plain Language Summarization of Medical Evidence
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
par: Joseph, Sebastian Antony, et autres
Publié: (2024)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
par: Chen, Xiuying, et autres
Publié: (2024)
par: Chen, Xiuying, et autres
Publié: (2024)
Role of Dependency Distance in Text Simplification: A Human vs ChatGPT Simplification Comparison
par: Lee, Sumi, et autres
Publié: (2024)
par: Lee, Sumi, et autres
Publié: (2024)
Utilizing Large Language Models to Generate Synthetic Data to Increase the Performance of BERT-Based Neural Networks
par: Woolsey, Chancellor R., et autres
Publié: (2024)
par: Woolsey, Chancellor R., et autres
Publié: (2024)
CASPR: Automated Evaluation Metric for Contrastive Summarization
par: Ananthamurugan, Nirupan, et autres
Publié: (2024)
par: Ananthamurugan, Nirupan, et autres
Publié: (2024)
Calibrating Model-Based Evaluation Metrics for Summarization
par: Liu, Hongye, et autres
Publié: (2026)
par: Liu, Hongye, et autres
Publié: (2026)
Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
par: Yari, Amir Hossein, et autres
Publié: (2025)
par: Yari, Amir Hossein, et autres
Publié: (2025)
Beyond N-Grams: Rethinking Evaluation Metrics and Strategies for Multilingual Abstractive Summarization
par: Mondshine, Itai, et autres
Publié: (2025)
par: Mondshine, Itai, et autres
Publié: (2025)
Research Borderlands: Analysing Writing Across Research Cultures
par: Bhatt, Shaily, et autres
Publié: (2025)
par: Bhatt, Shaily, et autres
Publié: (2025)
Fine-grained and Explainable Factuality Evaluation for Multimodal Summarization
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Evaluating Automatic Metrics with Incremental Machine Translation Systems
par: Wu, Guojun, et autres
Publié: (2024)
par: Wu, Guojun, et autres
Publié: (2024)
Automated Feedback Loops to Protect Text Simplification with Generative AI from Information Loss
par: Nandiraju, Abhay Kumara Sri Krishna, et autres
Publié: (2025)
par: Nandiraju, Abhay Kumara Sri Krishna, et autres
Publié: (2025)
Text and Audio Simplification: Human vs. ChatGPT
par: Leroy, Gondy, et autres
Publié: (2024)
par: Leroy, Gondy, et autres
Publié: (2024)
Effects of Added Emphasis and Pause in Audio Delivery of Health Information
par: Ahmed, Arif, et autres
Publié: (2024)
par: Ahmed, Arif, et autres
Publié: (2024)
ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?
par: Chan, Joey, et autres
Publié: (2026)
par: Chan, Joey, et autres
Publié: (2026)
CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints
par: Bologna, Federica, et autres
Publié: (2025)
par: Bologna, Federica, et autres
Publié: (2025)
Argument Summarization and its Evaluation in the Era of Large Language Models
par: Altemeyer, Moritz, et autres
Publié: (2025)
par: Altemeyer, Moritz, et autres
Publié: (2025)
Enhancing Argument Summarization: Prioritizing Exhaustiveness in Key Point Generation and Introducing an Automatic Coverage Evaluation Metric
par: Khosravani, Mohammad, et autres
Publié: (2024)
par: Khosravani, Mohammad, et autres
Publié: (2024)
FLAME: Financial Large-Language Model Assessment and Metrics Evaluation
par: Guo, Jiayu, et autres
Publié: (2025)
par: Guo, Jiayu, et autres
Publié: (2025)
EconNLI: Evaluating Large Language Models on Economics Reasoning
par: Guo, Yue, et autres
Publié: (2024)
par: Guo, Yue, et autres
Publié: (2024)
Scientific Opinion Summarization: Paper Meta-review Generation Dataset, Methods, and Evaluation
par: Zeng, Qi, et autres
Publié: (2023)
par: Zeng, Qi, et autres
Publié: (2023)
Mitigating the Impact of Reference Quality on Evaluation of Summarization Systems with Reference-Free Metrics
par: Gigant, Théo, et autres
Publié: (2024)
par: Gigant, Théo, et autres
Publié: (2024)
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with Writers
par: Subbiah, Melanie, et autres
Publié: (2024)
par: Subbiah, Melanie, et autres
Publié: (2024)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
par: Afzal, Anum, et autres
Publié: (2024)
par: Afzal, Anum, et autres
Publié: (2024)
Performance Evaluation of Large Language Models in Bangla Consumer Health Query Summarization
par: Abrar, Ajwad, et autres
Publié: (2025)
par: Abrar, Ajwad, et autres
Publié: (2025)
RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context
par: Petty, Jackson, et autres
Publié: (2025)
par: Petty, Jackson, et autres
Publié: (2025)
RES-Q: Evaluating Code-Editing Large Language Model Systems at the Repository Scale
par: LaBash, Beck, et autres
Publié: (2024)
par: LaBash, Beck, et autres
Publié: (2024)
SocialVeil: Probing Social Intelligence of Language Agents under Communication Barriers
par: Xuan, Keyang, et autres
Publié: (2026)
par: Xuan, Keyang, et autres
Publié: (2026)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
par: Yuan, Dong, et autres
Publié: (2024)
par: Yuan, Dong, et autres
Publié: (2024)
MMTE: Corpus and Metrics for Evaluating Machine Translation Quality of Metaphorical Language
par: Wang, Shun, et autres
Publié: (2024)
par: Wang, Shun, et autres
Publié: (2024)
An Automated Length-Aware Quality Metric for Summarization
par: Foland, Andrew D.
Publié: (2025)
par: Foland, Andrew D.
Publié: (2025)
Leveraging Hierarchical Organization for Medical Multi-document Summarization
par: Hsu, Yi-Li, et autres
Publié: (2025)
par: Hsu, Yi-Li, et autres
Publié: (2025)
TASE: Token Awareness and Structured Evaluation for Multilingual Language Models
par: Zhao, Chenzhuo, et autres
Publié: (2025)
par: Zhao, Chenzhuo, et autres
Publié: (2025)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
par: Yang, Xinqi, et autres
Publié: (2024)
par: Yang, Xinqi, et autres
Publié: (2024)
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
par: Min, Hyangsuk, et autres
Publié: (2025)
par: Min, Hyangsuk, et autres
Publié: (2025)
STORYSUMM: Evaluating Faithfulness in Story Summarization
par: Subbiah, Melanie, et autres
Publié: (2024)
par: Subbiah, Melanie, et autres
Publié: (2024)
Documents similaires
-
Are LLM-generated plain language summaries truly understandable? A large-scale crowdsourced evaluation
par: Guo, Yue, et autres
Publié: (2025) -
Retrieval augmentation of large language models for lay language generation
par: Guo, Yue, et autres
Publié: (2022) -
PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization
par: You, Zhiwen, et autres
Publié: (2025) -
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
par: Lucy, Li, et autres
Publié: (2024) -
FactPICO: Factuality Evaluation for Plain Language Summarization of Medical Evidence
par: Joseph, Sebastian Antony, et autres
Publié: (2024)