LLMs Do Not Grade Essays Like Humans
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mathew, Jerin George, Taher, Sumayya, Kundu, Anindita, Barbosa, Denilson |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Are Large Language Models Good Essay Graders?
par: Kundu, Anindita, et autres
Publié: (2024)
par: Kundu, Anindita, et autres
Publié: (2024)
How well can LLMs Grade Essays in Arabic?
par: Ghazawi, Rayed, et autres
Publié: (2025)
par: Ghazawi, Rayed, et autres
Publié: (2025)
Hey AI Can You Grade My Essay?: Automatic Essay Grading
par: Maliha, Maisha, et autres
Publié: (2024)
par: Maliha, Maisha, et autres
Publié: (2024)
Machine-Assisted Grading of Nationwide School-Leaving Essay Exams with LLMs and Statistical NLP
par: Karjus, Andres, et autres
Publié: (2026)
par: Karjus, Andres, et autres
Publié: (2026)
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
par: Amirizaniani, Maryam, et autres
Publié: (2024)
par: Amirizaniani, Maryam, et autres
Publié: (2024)
How Likely Do LLMs with CoT Mimic Human Reasoning?
par: Bao, Guangsheng, et autres
Publié: (2024)
par: Bao, Guangsheng, et autres
Publié: (2024)
Human-AI Collaborative Essay Scoring: A Dual-Process Framework with LLMs
par: Xiao, Changrong, et autres
Publié: (2024)
par: Xiao, Changrong, et autres
Publié: (2024)
Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation
par: Zhua, Fanwei, et autres
Publié: (2025)
par: Zhua, Fanwei, et autres
Publié: (2025)
Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs
par: Chu, SeongYeub, et autres
Publié: (2024)
par: Chu, SeongYeub, et autres
Publié: (2024)
Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral
par: Liu, Xiaoxiao, et autres
Publié: (2025)
par: Liu, Xiaoxiao, et autres
Publié: (2025)
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
par: Yehudai, Asaf, et autres
Publié: (2026)
par: Yehudai, Asaf, et autres
Publié: (2026)
Activations as Features: Probing LLMs for Generalizable Essay Scoring Representations
par: Chi, Jinwei, et autres
Publié: (2025)
par: Chi, Jinwei, et autres
Publié: (2025)
Do BERT-Like Bidirectional Models Still Perform Better on Text Classification in the Era of LLMs?
par: Zhang, Junyan, et autres
Publié: (2025)
par: Zhang, Junyan, et autres
Publié: (2025)
Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI
par: Wang, Yuxia, et autres
Publié: (2025)
par: Wang, Yuxia, et autres
Publié: (2025)
Assessing GPTZero's Accuracy in Identifying AI vs. Human-Written Essays
par: Dik, Selin, et autres
Publié: (2025)
par: Dik, Selin, et autres
Publié: (2025)
If LLMs Have Human-Like Attributes, Then So Does Age of Empires II
par: de Wynter, Adrian
Publié: (2026)
par: de Wynter, Adrian
Publié: (2026)
Do Large Language Models Solve ARC Visual Analogies Like People Do?
par: Opiełka, Gustaw, et autres
Publié: (2024)
par: Opiełka, Gustaw, et autres
Publié: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
Do LLMs Dream of Ontologies?
par: Bombieri, Marco, et autres
Publié: (2024)
par: Bombieri, Marco, et autres
Publié: (2024)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
par: Kubesch, Jonas, et autres
Publié: (2026)
par: Kubesch, Jonas, et autres
Publié: (2026)
Gender Encoding Patterns in Pretrained Language Model Representations
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
Blind Men and the Elephant: Diverse Perspectives on Gender Stereotypes in Benchmark Datasets
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
par: Zakizadeh, Mahdi, et autres
Publié: (2025)
How Do LLMs Use Their Depth?
par: Gupta, Akshat, et autres
Publié: (2025)
par: Gupta, Akshat, et autres
Publié: (2025)
Do LLMs have Consistent Values?
par: Rozen, Naama, et autres
Publié: (2024)
par: Rozen, Naama, et autres
Publié: (2024)
Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs
par: Camassa, Carolina, et autres
Publié: (2026)
par: Camassa, Carolina, et autres
Publié: (2026)
Dynamic Depth Decoding: Faster Speculative Decoding for LLMs
par: Brown, Oscar, et autres
Publié: (2024)
par: Brown, Oscar, et autres
Publié: (2024)
Enhancing Human-Like Responses in Large Language Models
par: Çalık, Ethem Yağız, et autres
Publié: (2025)
par: Çalık, Ethem Yağız, et autres
Publié: (2025)
Do LLMs Benefit From Their Own Words?
par: Huang, Jenny Y., et autres
Publié: (2026)
par: Huang, Jenny Y., et autres
Publié: (2026)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
par: Su, Jiamin, et autres
Publié: (2025)
par: Su, Jiamin, et autres
Publié: (2025)
SteLLA: A Structured Grading System Using LLMs with RAG
par: Qiu, Hefei, et autres
Publié: (2025)
par: Qiu, Hefei, et autres
Publié: (2025)
A LLM-Powered Automatic Grading Framework with Human-Level Guidelines Optimization
par: Chu, Yucheng, et autres
Publié: (2024)
par: Chu, Yucheng, et autres
Publié: (2024)
Can Large Language Models Express Uncertainty Like Human?
par: Tao, Linwei, et autres
Publié: (2025)
par: Tao, Linwei, et autres
Publié: (2025)
Do LLMs "Feel"? Emotion Circuits Discovery and Control
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
Do LLMs estimate uncertainty well in instruction-following?
par: Heo, Juyeon, et autres
Publié: (2024)
par: Heo, Juyeon, et autres
Publié: (2024)
Do LLMs "know" internally when they follow instructions?
par: Heo, Juyeon, et autres
Publié: (2024)
par: Heo, Juyeon, et autres
Publié: (2024)
How Well Do LLMs Understand Tunisian Arabic?
par: Mahdi, Mohamed
Publié: (2025)
par: Mahdi, Mohamed
Publié: (2025)
Do LLMs Agree on the Creativity Evaluation of Alternative Uses?
par: Rabeyah, Abdullah Al, et autres
Publié: (2024)
par: Rabeyah, Abdullah Al, et autres
Publié: (2024)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?
par: Billa, Jayadev
Publié: (2026)
par: Billa, Jayadev
Publié: (2026)
Documents similaires
-
Are Large Language Models Good Essay Graders?
par: Kundu, Anindita, et autres
Publié: (2024) -
How well can LLMs Grade Essays in Arabic?
par: Ghazawi, Rayed, et autres
Publié: (2025) -
Hey AI Can You Grade My Essay?: Automatic Essay Grading
par: Maliha, Maisha, et autres
Publié: (2024) -
Machine-Assisted Grading of Nationwide School-Leaving Essay Exams with LLMs and Statistical NLP
par: Karjus, Andres, et autres
Publié: (2026) -
Do LLMs Exhibit Human-Like Reasoning? Evaluating Theory of Mind in LLMs for Open-Ended Responses
par: Amirizaniani, Maryam, et autres
Publié: (2024)