LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Byun, Grace, Rajwal, Swati, Choi, Jinho D. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Decade of Natural Language Processing in Chronic Pain: A Systematic Review
by: Rajwal, Swati
Published: (2024)
by: Rajwal, Swati
Published: (2024)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
by: Hong, Jiseung, et al.
Published: (2025)
by: Hong, Jiseung, et al.
Published: (2025)
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models
by: Ascoli, Benjamin G., et al.
Published: (2024)
by: Ascoli, Benjamin G., et al.
Published: (2024)
CHiL(L)Grader: Calibrated Human-in-the-Loop Short-Answer Grading
by: Raikote, Pranav, et al.
Published: (2026)
by: Raikote, Pranav, et al.
Published: (2026)
HILGEN: Hierarchically-Informed Data Generation for Biomedical NER Using Knowledgebases and Large Language Models
by: Ge, Yao, et al.
Published: (2025)
by: Ge, Yao, et al.
Published: (2025)
CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection
by: Byun, Grace, et al.
Published: (2025)
by: Byun, Grace, et al.
Published: (2025)
Large Language Models As MOOCs Graders
by: Golchin, Shahriar, et al.
Published: (2024)
by: Golchin, Shahriar, et al.
Published: (2024)
Are Large Language Models Good Essay Graders?
by: Kundu, Anindita, et al.
Published: (2024)
by: Kundu, Anindita, et al.
Published: (2024)
What is Your Favorite Gender, MLM? Gender Bias Evaluation in Multilingual Masked Language Models
by: Yu, Jeongrok, et al.
Published: (2024)
by: Yu, Jeongrok, et al.
Published: (2024)
Do Biased Models Have Biased Thoughts?
by: Rajwal, Swati, et al.
Published: (2025)
by: Rajwal, Swati, et al.
Published: (2025)
Identifying social isolation themes in NVDRS text narratives using topic modeling and text-classification methods
by: Walker, Drew, et al.
Published: (2025)
by: Walker, Drew, et al.
Published: (2025)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
by: Lai, Peichao, et al.
Published: (2025)
by: Lai, Peichao, et al.
Published: (2025)
Integrated Framework for LLM Evaluation with Answer Generation
by: Lee, Sujeong, et al.
Published: (2025)
by: Lee, Sujeong, et al.
Published: (2025)
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
by: Iranmanesh, Reihaneh, et al.
Published: (2026)
by: Iranmanesh, Reihaneh, et al.
Published: (2026)
Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models
by: Wu, Peilin, et al.
Published: (2025)
by: Wu, Peilin, et al.
Published: (2025)
Language Models are Few-Shot Graders
by: Zhao, Chenyan, et al.
Published: (2025)
by: Zhao, Chenyan, et al.
Published: (2025)
Evaluating Nuanced Bias in Large Language Model Free Response Answers
by: Healey, Jennifer, et al.
Published: (2024)
by: Healey, Jennifer, et al.
Published: (2024)
Leveraging Explicit Reasoning for Inference Integration in Commonsense-Augmented Dialogue Models
by: Finch, Sarah E., et al.
Published: (2024)
by: Finch, Sarah E., et al.
Published: (2024)
The Veln(ia)s is in the Details: Evaluating LLM Judgment on Latvian and Lithuanian Short Answer Matching
by: Kostiuk, Yevhen, et al.
Published: (2025)
by: Kostiuk, Yevhen, et al.
Published: (2025)
Towards LLM-based Autograding for Short Textual Answers
by: Schneider, Johannes, et al.
Published: (2023)
by: Schneider, Johannes, et al.
Published: (2023)
Enhancing LLM-Based Short Answer Grading with Retrieval-Augmented Generation
by: Chu, Yucheng, et al.
Published: (2025)
by: Chu, Yucheng, et al.
Published: (2025)
Automating PTSD Diagnostics in Clinical Interviews: Leveraging Large Language Models for Trauma Assessments
by: Tu, Sichang, et al.
Published: (2024)
by: Tu, Sichang, et al.
Published: (2024)
Evaluation Methodology for Large Language Models for Multilingual Document Question and Answer
by: Kahana, Adar, et al.
Published: (2024)
by: Kahana, Adar, et al.
Published: (2024)
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
by: Ehsan, Md. Alvee, et al.
Published: (2025)
by: Ehsan, Md. Alvee, et al.
Published: (2025)
Diagnosing Failures in Large Language Models' Answers: Integrating Error Attribution into Evaluation Framework
by: Xu, Zishan, et al.
Published: (2025)
by: Xu, Zishan, et al.
Published: (2025)
Diverse and Effective Synthetic Data Generation for Adaptable Zero-Shot Dialogue State Tracking
by: Finch, James D., et al.
Published: (2024)
by: Finch, James D., et al.
Published: (2024)
Can You Trick the Grader? Adversarial Persuasion of LLM Judges
by: Hwang, Yerin, et al.
Published: (2025)
by: Hwang, Yerin, et al.
Published: (2025)
Can Large Language Models Make the Grade? An Empirical Study Evaluating LLMs Ability to Mark Short Answer Questions in K-12 Education
by: Henkel, Owen, et al.
Published: (2024)
by: Henkel, Owen, et al.
Published: (2024)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
by: Jo, Hwiyeol, et al.
Published: (2025)
by: Jo, Hwiyeol, et al.
Published: (2025)
Refining Answer Distributions for Improved Large Language Model Reasoning
by: Pal, Soumyasundar, et al.
Published: (2024)
by: Pal, Soumyasundar, et al.
Published: (2024)
ConvoSense: Overcoming Monotonous Commonsense Inferences for Conversational AI
by: Finch, Sarah E., et al.
Published: (2024)
by: Finch, Sarah E., et al.
Published: (2024)
TRUST: An LLM-Based Dialogue System for Trauma Understanding and Structured Assessments
by: Tu, Sichang, et al.
Published: (2025)
by: Tu, Sichang, et al.
Published: (2025)
Automatic Feedback Generation for Short Answer Questions using Answer Diagnostic Graphs
by: Furuhashi, Momoka, et al.
Published: (2025)
by: Furuhashi, Momoka, et al.
Published: (2025)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
by: He, Jiahang, et al.
Published: (2025)
by: He, Jiahang, et al.
Published: (2025)
Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
by: Byun, Hoyoon, et al.
Published: (2025)
by: Byun, Hoyoon, et al.
Published: (2025)
DataAgent: Evaluating Large Language Models' Ability to Answer Zero-Shot, Natural Language Queries
by: Mishra, Manit, et al.
Published: (2024)
by: Mishra, Manit, et al.
Published: (2024)
PersonaKit (PK): A Plug-and-Play Platform for User Testing Diverse Roles in Full-Duplex Dialogue
by: Jeon, Hyunbae, et al.
Published: (2026)
by: Jeon, Hyunbae, et al.
Published: (2026)
Application of CARE-SD text classifier tools to assess distribution of stigmatizing and doubt-marking language features in EHR
by: Walker, Drew, et al.
Published: (2025)
by: Walker, Drew, et al.
Published: (2025)
Similar Items
-
D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
by: Byun, Grace, et al.
Published: (2025) -
Decade of Natural Language Processing in Chronic Pain: A Systematic Review
by: Rajwal, Swati
Published: (2024) -
Measuring Sycophancy of Language Models in Multi-turn Dialogues
by: Hong, Jiseung, et al.
Published: (2025) -
Secure Multifaceted-RAG for Enterprise: Hybrid Knowledge Retrieval with Security Filtering
by: Byun, Grace, et al.
Published: (2025) -
ETM: Modern Insights into Perspective on Text-to-SQL Evaluation in the Age of Large Language Models
by: Ascoli, Benjamin G., et al.
Published: (2024)