LLM-based Automated Grading with Human-in-the-Loop
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chu, Yucheng, Li, Hang, Yang, Kaiqi, Copur-Gencturk, Yasemin, Tang, Jiliang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimizing In-Context Demonstrations for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
A LLM-Powered Automatic Grading Framework with Human-Level Guidelines Optimization
par: Chu, Yucheng, et autres
Publié: (2024)
par: Chu, Yucheng, et autres
Publié: (2024)
From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
A LLM-Driven Multi-Agent Systems for Professional Development of Mathematics Teachers
par: Yang, Kaiqi, et autres
Publié: (2025)
par: Yang, Kaiqi, et autres
Publié: (2025)
Content Knowledge Identification with Multi-Agent Large Language Models (LLMs)
par: Yang, Kaiqi, et autres
Publié: (2024)
par: Yang, Kaiqi, et autres
Publié: (2024)
Enhancing LLM-Based Short Answer Grading with Retrieval-Augmented Generation
par: Chu, Yucheng, et autres
Publié: (2025)
par: Chu, Yucheng, et autres
Publié: (2025)
Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
par: Li, Hang, et autres
Publié: (2025)
par: Li, Hang, et autres
Publié: (2025)
How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment
par: Li, Hang, et autres
Publié: (2026)
par: Li, Hang, et autres
Publié: (2026)
Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
par: Yang, Kaiqi, et autres
Publié: (2025)
par: Yang, Kaiqi, et autres
Publié: (2025)
Automate Knowledge Concept Tagging on Math Questions with LLMs
par: Li, Hang, et autres
Publié: (2024)
par: Li, Hang, et autres
Publié: (2024)
Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem Solutions
par: Li, Hang, et autres
Publié: (2024)
par: Li, Hang, et autres
Publié: (2024)
Knowledge Tagging System on Math Questions via LLMs with Flexible Demonstration Retriever
par: Li, Hang, et autres
Publié: (2024)
par: Li, Hang, et autres
Publié: (2024)
CHiL(L)Grader: Calibrated Human-in-the-Loop Short-Answer Grading
par: Raikote, Pranav, et autres
Publié: (2026)
par: Raikote, Pranav, et autres
Publié: (2026)
Keeping Humans in the Loop: Human-Centered Automated Annotation with Generative AI
par: Pangakis, Nicholas, et autres
Publié: (2024)
par: Pangakis, Nicholas, et autres
Publié: (2024)
From Human Annotation to Automation: LLM-in-the-Loop Active Learning for Arabic Sentiment Analysis
par: Refai, Dania, et autres
Publié: (2025)
par: Refai, Dania, et autres
Publié: (2025)
Grading Scale Impact on LLM-as-a-Judge: Human-LLM Alignment Is Highest on 0-5 Grading Scale
par: Li, Weiyue, et autres
Publié: (2026)
par: Li, Weiyue, et autres
Publié: (2026)
Hands-On Tutorial: Labeling with LLM and Human-in-the-Loop
par: Artemova, Ekaterina, et autres
Publié: (2024)
par: Artemova, Ekaterina, et autres
Publié: (2024)
RocketEval: Efficient Automated LLM Evaluation via Grading Checklist
par: Wei, Tianjun, et autres
Publié: (2025)
par: Wei, Tianjun, et autres
Publié: (2025)
From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP
par: Samu, Most. Sharmin Sultana, et autres
Publié: (2026)
par: Samu, Most. Sharmin Sultana, et autres
Publié: (2026)
TSAssistant: A Human-in-the-Loop Agentic Framework for Automated Target Safety Assessment
par: Zheng, Xiaochen, et autres
Publié: (2026)
par: Zheng, Xiaochen, et autres
Publié: (2026)
KOALA: Enhancing Speculative Decoding for LLM via Multi-Layer Draft Heads with Adversarial Learning
par: Zhang, Kaiqi, et autres
Publié: (2024)
par: Zhang, Kaiqi, et autres
Publié: (2024)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
par: Liu, Xuannan, et autres
Publié: (2026)
par: Liu, Xuannan, et autres
Publié: (2026)
Towards A Human-in-the-Loop LLM Approach to Collaborative Discourse Analysis
par: Cohn, Clayton, et autres
Publié: (2024)
par: Cohn, Clayton, et autres
Publié: (2024)
Scalable Fact-checking with Human-in-the-Loop
par: Yang, Jing, et autres
Publié: (2021)
par: Yang, Jing, et autres
Publié: (2021)
Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness
par: Deng, Haotian, et autres
Publié: (2025)
par: Deng, Haotian, et autres
Publié: (2025)
Feeding LLM Annotations to BERT Classifiers at Your Own Risk
par: Lu, Yucheng, et autres
Publié: (2025)
par: Lu, Yucheng, et autres
Publié: (2025)
Automated Long Answer Grading with RiceChem Dataset
par: Sonkar, Shashank, et autres
Publié: (2024)
par: Sonkar, Shashank, et autres
Publié: (2024)
Evil Geniuses: Delving into the Safety of LLM-based Agents
par: Tian, Yu, et autres
Publié: (2023)
par: Tian, Yu, et autres
Publié: (2023)
TALEC: Teach Your LLM to Evaluate in Specific Domain with In-house Criteria by Criteria Division and Zero-shot Plus Few-shot
par: Zhang, Kaiqi, et autres
Publié: (2024)
par: Zhang, Kaiqi, et autres
Publié: (2024)
LLM-based Human Simulations Have Not Yet Been Reliable
par: Wang, Qian, et autres
Publié: (2025)
par: Wang, Qian, et autres
Publié: (2025)
A Human-in/on-the-Loop Framework for Accessible Text Generation
par: Moreno, Lourdes, et autres
Publié: (2026)
par: Moreno, Lourdes, et autres
Publié: (2026)
PersonaFuse: A Personality Activation-Driven Framework for Enhancing Human-LLM Interactions
par: Tang, Yixuan, et autres
Publié: (2025)
par: Tang, Yixuan, et autres
Publié: (2025)
Grade Guard: A Smart System for Short Answer Automated Grading
par: Dadu, Niharika, et autres
Publié: (2025)
par: Dadu, Niharika, et autres
Publié: (2025)
AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent
par: Li, Yu, et autres
Publié: (2025)
par: Li, Yu, et autres
Publié: (2025)
Quantifying and Predicting Disagreement in Graded Human Ratings
par: Zhang, Leixin, et autres
Publié: (2026)
par: Zhang, Leixin, et autres
Publié: (2026)
A Human-in-the-Loop, LLM-Centered Architecture for Knowledge-Graph Question Answering
par: Pusch, Larissa, et autres
Publié: (2026)
par: Pusch, Larissa, et autres
Publié: (2026)
LoopRPT: Reinforcement Pre-Training for Looped Language Models
par: Tang, Guo, et autres
Publié: (2026)
par: Tang, Guo, et autres
Publié: (2026)
Are Large Language Models (LLMs) Good Social Predictors?
par: Yang, Kaiqi, et autres
Publié: (2024)
par: Yang, Kaiqi, et autres
Publié: (2024)
The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
par: Abeysinghe, Bhashithe, et autres
Publié: (2024)
Documents similaires
-
Optimizing In-Context Demonstrations for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026) -
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026) -
A LLM-Powered Automatic Grading Framework with Human-Level Guidelines Optimization
par: Chu, Yucheng, et autres
Publié: (2024) -
From Flat to Structural: Enhancing Automated Short Answer Grading with GraphRAG
par: Chu, Yucheng, et autres
Publié: (2026) -
A LLM-Driven Multi-Agent Systems for Professional Development of Mathematics Teachers
par: Yang, Kaiqi, et autres
Publié: (2025)