Not too long do read: Evaluating LLM-generated extreme scientific summaries
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lyu, Zhuoqi, Ke, Qing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
COMO: Closed-Loop Optical Molecule Recognition with Minimum Risk Training
par: Lyu, Zhuoqi, et autres
Publié: (2026)
par: Lyu, Zhuoqi, et autres
Publié: (2026)
Unused information in token probability distribution of generative LLM: improving LLM reading comprehension through calculation of expected values
par: Zawistowski, Krystian
Publié: (2024)
par: Zawistowski, Krystian
Publié: (2024)
Towards understanding evolution of science through language model series
par: Dong, Junjie, et autres
Publié: (2024)
par: Dong, Junjie, et autres
Publié: (2024)
Reveal and Release: Iterative LLM Unlearning with Self-generated Data
par: Xie, Linxi, et autres
Publié: (2025)
par: Xie, Linxi, et autres
Publié: (2025)
Towards an automatic method for generating topical vocabulary test forms for specific reading passages
par: Flor, Michael, et autres
Publié: (2025)
par: Flor, Michael, et autres
Publié: (2025)
Talking to Machines: do you read me?
par: Rojas-Barahona, Lina M.
Publié: (2024)
par: Rojas-Barahona, Lina M.
Publié: (2024)
LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability
par: Xu, Xuan, et autres
Publié: (2025)
par: Xu, Xuan, et autres
Publié: (2025)
Benchmark of stylistic variation in LLM-generated texts
par: Milička, Jiří, et autres
Publié: (2025)
par: Milička, Jiří, et autres
Publié: (2025)
Gender Bias in LLM-generated Interview Responses
par: Kong, Haein, et autres
Publié: (2024)
par: Kong, Haein, et autres
Publié: (2024)
Learning to Summarize from LLM-generated Feedback
par: Song, Hwanjun, et autres
Publié: (2024)
par: Song, Hwanjun, et autres
Publié: (2024)
Semantic uncertainty in advanced decoding methods for LLM generation
par: Foodeei, Darius, et autres
Publié: (2025)
par: Foodeei, Darius, et autres
Publié: (2025)
Temperature-scaling surprisal estimates improve fit to human reading times -- but does it do so for the "right reasons"?
par: Liu, Tong, et autres
Publié: (2023)
par: Liu, Tong, et autres
Publié: (2023)
AI-University: An LLM-based platform for instructional alignment to scientific classrooms
par: Shojaei, Mostafa Faghih, et autres
Publié: (2025)
par: Shojaei, Mostafa Faghih, et autres
Publié: (2025)
Modeling cognitive processes of natural reading with transformer-based Language Models
par: Bianchi, Bruno, et autres
Publié: (2025)
par: Bianchi, Bruno, et autres
Publié: (2025)
Multi-Agent LLM Judge: automatic personalized LLM judge design for evaluating natural language generation applications
par: Cao, Hongliu, et autres
Publié: (2025)
par: Cao, Hongliu, et autres
Publié: (2025)
Ada-LEval: Evaluating long-context LLMs with length-adaptable benchmarks
par: Wang, Chonghua, et autres
Publié: (2024)
par: Wang, Chonghua, et autres
Publié: (2024)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
par: Liu, Jiayu, et autres
Publié: (2025)
par: Liu, Jiayu, et autres
Publié: (2025)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
par: Yuan, Dong, et autres
Publié: (2024)
par: Yuan, Dong, et autres
Publié: (2024)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
par: Ke, Pei, et autres
Publié: (2023)
par: Ke, Pei, et autres
Publié: (2023)
CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
par: Kim, Keuntae, et autres
Publié: (2025)
par: Kim, Keuntae, et autres
Publié: (2025)
LLM-as-a-qualitative-judge: automating error analysis in natural language generation
par: Chirkova, Nadezhda, et autres
Publié: (2025)
par: Chirkova, Nadezhda, et autres
Publié: (2025)
Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation
par: Macko, Dominik, et autres
Publié: (2025)
par: Macko, Dominik, et autres
Publié: (2025)
Data Compressibility Quantifies LLM Memorization
par: Huang, Yizhan, et autres
Publié: (2025)
par: Huang, Yizhan, et autres
Publié: (2025)
Evaluating Metrics for Safety with LLM-as-Judges
par: Clegg, Kester, et autres
Publié: (2025)
par: Clegg, Kester, et autres
Publié: (2025)
CSCE: Boosting LLM Reasoning by Simultaneous Enhancing of Causal Significance and Consistency
par: Wang, Kangsheng, et autres
Publié: (2024)
par: Wang, Kangsheng, et autres
Publié: (2024)
LLM Prompt Evaluation for Educational Applications
par: Holmes, Langdon, et autres
Publié: (2026)
par: Holmes, Langdon, et autres
Publié: (2026)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2024)
par: Kim, Eunsu, et autres
Publié: (2024)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
par: Shen, Ke, et autres
Publié: (2024)
par: Shen, Ke, et autres
Publié: (2024)
Cross-cultural Inspiration Detection and Analysis in Real and LLM-generated Social Media Data
par: Ignat, Oana, et autres
Publié: (2024)
par: Ignat, Oana, et autres
Publié: (2024)
The "LLM World of Words" English free association norms generated by large language models
par: Abramski, Katherine, et autres
Publié: (2024)
par: Abramski, Katherine, et autres
Publié: (2024)
Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content
par: Mushtaq, Abdullah, et autres
Publié: (2025)
par: Mushtaq, Abdullah, et autres
Publié: (2025)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
par: Lyu, Xinxi, et autres
Publié: (2024)
par: Lyu, Xinxi, et autres
Publié: (2024)
The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
par: Han, Feijiang, et autres
Publié: (2025)
par: Han, Feijiang, et autres
Publié: (2025)
The why, what, and how of AI-based coding in scientific research
par: Zhuang, Tonghe, et autres
Publié: (2024)
par: Zhuang, Tonghe, et autres
Publié: (2024)
Rethinking Human Preference Evaluation of LLM Rationales
par: Li, Ziang, et autres
Publié: (2025)
par: Li, Ziang, et autres
Publié: (2025)
Integrated Framework for LLM Evaluation with Answer Generation
par: Lee, Sujeong, et autres
Publié: (2025)
par: Lee, Sujeong, et autres
Publié: (2025)
Evaluating the Diversity and Quality of LLM Generated Content
par: Shypula, Alexander, et autres
Publié: (2025)
par: Shypula, Alexander, et autres
Publié: (2025)
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
MERA: A Comprehensive LLM Evaluation in Russian
par: Fenogenova, Alena, et autres
Publié: (2024)
par: Fenogenova, Alena, et autres
Publié: (2024)
Documents similaires
-
COMO: Closed-Loop Optical Molecule Recognition with Minimum Risk Training
par: Lyu, Zhuoqi, et autres
Publié: (2026) -
Unused information in token probability distribution of generative LLM: improving LLM reading comprehension through calculation of expected values
par: Zawistowski, Krystian
Publié: (2024) -
Towards understanding evolution of science through language model series
par: Dong, Junjie, et autres
Publié: (2024) -
Reveal and Release: Iterative LLM Unlearning with Self-generated Data
par: Xie, Linxi, et autres
Publié: (2025) -
Towards an automatic method for generating topical vocabulary test forms for specific reading passages
par: Flor, Michael, et autres
Publié: (2025)