Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Yinuo, Sezgin, Emre, Youngstrom, Eric A. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
An Empirical Analysis on Large Language Models in Debate Evaluation
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
von: Yang, Xinqi, et al.
Veröffentlicht: (2024)
von: Yang, Xinqi, et al.
Veröffentlicht: (2024)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
von: Xie, Qiujie, et al.
Veröffentlicht: (2025)
von: Xie, Qiujie, et al.
Veröffentlicht: (2025)
An Empirical Evaluation of Large Language Models on Consumer Health Questions
von: Abrar, Moaiz, et al.
Veröffentlicht: (2024)
von: Abrar, Moaiz, et al.
Veröffentlicht: (2024)
Evaluating Ill-Defined Tasks in Large Language Models
von: Zhou, Yi, et al.
Veröffentlicht: (2026)
von: Zhou, Yi, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models for Real-World Engineering Tasks
von: Heesch, Rene, et al.
Veröffentlicht: (2025)
von: Heesch, Rene, et al.
Veröffentlicht: (2025)
MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
von: Bedi, Suhana, et al.
Veröffentlicht: (2025)
Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks
von: Anand, Avinash, et al.
Veröffentlicht: (2024)
von: Anand, Avinash, et al.
Veröffentlicht: (2024)
Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition
von: Tang, Xuemei, et al.
Veröffentlicht: (2024)
von: Tang, Xuemei, et al.
Veröffentlicht: (2024)
An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques
von: Aly, Walid Mohamed, et al.
Veröffentlicht: (2025)
von: Aly, Walid Mohamed, et al.
Veröffentlicht: (2025)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
Large Language Models as User-Agents for Evaluating Task-Oriented-Dialogue Systems
von: Kazi, Taaha, et al.
Veröffentlicht: (2024)
von: Kazi, Taaha, et al.
Veröffentlicht: (2024)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
An Empirical Study on Prompt Compression for Large Language Models
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
Evaluating Quantized Large Language Models
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
von: Li, Shiyao, et al.
Veröffentlicht: (2024)
Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
von: Liu, Shuodi, et al.
Veröffentlicht: (2025)
von: Liu, Shuodi, et al.
Veröffentlicht: (2025)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
von: Jahan, Israt, et al.
Veröffentlicht: (2023)
Evaluation of Large Language Models for Summarization Tasks in the Medical Domain: A Narrative Review
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
von: Croxford, Emma, et al.
Veröffentlicht: (2024)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
An Empirical Study of Many-to-Many Summarization with Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
von: Yao, Xuan, et al.
Veröffentlicht: (2025)
THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering
von: Patel, Udita, et al.
Veröffentlicht: (2025)
von: Patel, Udita, et al.
Veröffentlicht: (2025)
Can Large Language Models Make the Grade? An Empirical Study Evaluating LLMs Ability to Mark Short Answer Questions in K-12 Education
von: Henkel, Owen, et al.
Veröffentlicht: (2024)
von: Henkel, Owen, et al.
Veröffentlicht: (2024)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
von: Chern, Steffi, et al.
Veröffentlicht: (2024)
von: Chern, Steffi, et al.
Veröffentlicht: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models
von: Jones, Jaylen, et al.
Veröffentlicht: (2024)
von: Jones, Jaylen, et al.
Veröffentlicht: (2024)
An Empirical Study of the Role of Incompleteness and Ambiguity in Interactions with Large Language Models
von: Naik, Riya, et al.
Veröffentlicht: (2025)
von: Naik, Riya, et al.
Veröffentlicht: (2025)
An Empirical Comparison of Text Summarization: A Multi-Dimensional Evaluation of Large Language Models
von: Janakiraman, Anantharaman, et al.
Veröffentlicht: (2025)
von: Janakiraman, Anantharaman, et al.
Veröffentlicht: (2025)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
Contextual Evaluation of Large Language Models for Classifying Tropical and Infectious Diseases
von: Asiedu, Mercy, et al.
Veröffentlicht: (2024)
von: Asiedu, Mercy, et al.
Veröffentlicht: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
von: Huang, Yan, et al.
Veröffentlicht: (2024)
von: Huang, Yan, et al.
Veröffentlicht: (2024)
Evaluating the Retrieval Robustness of Large Language Models
von: Cao, Shuyang, et al.
Veröffentlicht: (2025)
von: Cao, Shuyang, et al.
Veröffentlicht: (2025)
Evaluating Spatial Understanding of Large Language Models
von: Yamada, Yutaro, et al.
Veröffentlicht: (2023)
von: Yamada, Yutaro, et al.
Veröffentlicht: (2023)
Realistic Evaluation of Toxicity in Large Language Models
von: Luong, Tinh Son, et al.
Veröffentlicht: (2024)
von: Luong, Tinh Son, et al.
Veröffentlicht: (2024)
Role-Playing Evaluation for Large Language Models
von: Boudouri, Yassine El, et al.
Veröffentlicht: (2025)
von: Boudouri, Yassine El, et al.
Veröffentlicht: (2025)
A Survey on Evaluation of Large Language Models
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
von: Chang, Yupeng, et al.
Veröffentlicht: (2023)
The Emergence of Abstract Thought in Large Language Models Beyond Any Language
von: Chen, Yuxin, et al.
Veröffentlicht: (2025)
von: Chen, Yuxin, et al.
Veröffentlicht: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
An Empirical Analysis on Large Language Models in Debate Evaluation
von: Liu, Xinyi, et al.
Veröffentlicht: (2024) -
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
von: Yang, Xinqi, et al.
Veröffentlicht: (2024) -
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
von: Xie, Qiujie, et al.
Veröffentlicht: (2025) -
An Empirical Evaluation of Large Language Models on Consumer Health Questions
von: Abrar, Moaiz, et al.
Veröffentlicht: (2024) -
Evaluating Ill-Defined Tasks in Large Language Models
von: Zhou, Yi, et al.
Veröffentlicht: (2026)