Evaluating Language Models for Generating and Judging Programming Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Koutcheme, Charles, Dainese, Nicola, Hellas, Arto, Sarsa, Sami, Leinonen, Juho, Ashraf, Syed, Denny, Paul |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Open Source Language Models Can Provide Feedback: Evaluating LLMs' Ability to Help Students Using GPT-4-As-A-Judge
par: Koutcheme, Charles, et autres
Publié: (2024)
par: Koutcheme, Charles, et autres
Publié: (2024)
Benchmarking Educational Program Repair
par: Koutcheme, Charles, et autres
Publié: (2024)
par: Koutcheme, Charles, et autres
Publié: (2024)
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
par: Koutcheme, Charles, et autres
Publié: (2026)
par: Koutcheme, Charles, et autres
Publié: (2026)
Evaluating Contextually Personalized Programming Exercises Created with Generative AI
par: Logacheva, Evanfiya, et autres
Publié: (2024)
par: Logacheva, Evanfiya, et autres
Publié: (2024)
On the Opportunities of Large Language Models for Programming Process Data
par: Edwards, John, et autres
Publié: (2024)
par: Edwards, John, et autres
Publié: (2024)
Comparing Code Explanations Created by Students and Large Language Models
par: Leinonen, Juho, et autres
Publié: (2023)
par: Leinonen, Juho, et autres
Publié: (2023)
Using Large Language Models to Enhance Programming Error Messages
par: Leinonen, Juho, et autres
Publié: (2022)
par: Leinonen, Juho, et autres
Publié: (2022)
AI-Generated Slides: Are They Good? Can Students Tell?
par: Leinonen, Juho, et autres
Publié: (2026)
par: Leinonen, Juho, et autres
Publié: (2026)
Synthetic Students: A Comparative Study of Bug Distribution Between Large Language Models and Computing Students
par: MacNeil, Stephen, et autres
Publié: (2024)
par: MacNeil, Stephen, et autres
Publié: (2024)
LLM-itation is the Sincerest Form of Data: Generating Synthetic Buggy Code Submissions for Computing Education
par: Leinonen, Juho, et autres
Publié: (2024)
par: Leinonen, Juho, et autres
Publié: (2024)
"Like a Nesting Doll": Analyzing Recursion Analogies Generated by CS Students using Large Language Models
par: Bernstein, Seth, et autres
Publié: (2024)
par: Bernstein, Seth, et autres
Publié: (2024)
Let's Ask AI About Their Programs: Exploring ChatGPT's Answers To Program Comprehension Questions
par: Lehtinen, Teemu, et autres
Publié: (2024)
par: Lehtinen, Teemu, et autres
Publié: (2024)
Experiences from Integrating Large Language Model Chatbots into the Classroom
par: Hellas, Arto, et autres
Publié: (2024)
par: Hellas, Arto, et autres
Publié: (2024)
Comparing the Utility, Preference, and Performance of Course Material Search Functionality and Retrieval-Augmented Generation Large Language Model (RAG-LLM) AI Chatbots in Information-Seeking Tasks
par: Pasquarelli, Leonardo, et autres
Publié: (2024)
par: Pasquarelli, Leonardo, et autres
Publié: (2024)
Narrowing the Gap: Supervised Fine-Tuning of Open-Source LLMs as a Viable Alternative to Proprietary Models for Pedagogical Tools
par: Solano, Lorenzo Lee, et autres
Publié: (2025)
par: Solano, Lorenzo Lee, et autres
Publié: (2025)
Personalized Worked Example Generation from Student Code Submissions Using Pattern-based Knowledge Components
par: Pitts, Griffin, et autres
Publié: (2026)
par: Pitts, Griffin, et autres
Publié: (2026)
The Missing Evaluation Axis: What 10,000 Student Submissions Reveal About AI Tutor Effectiveness
par: Niousha, Rose, et autres
Publié: (2026)
par: Niousha, Rose, et autres
Publié: (2026)
Integrating Natural Language Prompting Tasks in Introductory Programming Courses
par: Kerslake, Chris, et autres
Publié: (2024)
par: Kerslake, Chris, et autres
Publié: (2024)
Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education
par: Jain, Mragisha, et autres
Publié: (2026)
par: Jain, Mragisha, et autres
Publié: (2026)
Humanizing Automated Programming Feedback: Fine-Tuning Generative Models with Student-Written Feedback
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
par: Bao, Qiming, et autres
Publié: (2026)
par: Bao, Qiming, et autres
Publié: (2026)
Prompt Programming: A Platform for Dialogue-based Computational Problem Solving with Generative AI Models
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
Breaking the Programming Language Barrier: Multilingual Prompting to Empower Non-Native English Learners
par: Prather, James, et autres
Publié: (2024)
par: Prather, James, et autres
Publié: (2024)
Automating Autograding: Large Language Models as Test Suite Generators for Introductory Programming
par: Alkafaween, Umar, et autres
Publié: (2024)
par: Alkafaween, Umar, et autres
Publié: (2024)
Evaluating the Application of Large Language Models to Generate Feedback in Programming Education
par: Jacobs, Sven, et autres
Publié: (2024)
par: Jacobs, Sven, et autres
Publié: (2024)
Interleaving Natural Language Prompting with Code Editing for Solving Programming Tasks with Generative AI Models
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
Probing the Unknown: Exploring Student Interactions with Probeable Problems at Scale in Introductory Programming
par: Denny, Paul, et autres
Publié: (2025)
par: Denny, Paul, et autres
Publié: (2025)
The Role of Generative AI in Software Student CollaborAItion
par: Kiesler, Natalie, et autres
Publié: (2025)
par: Kiesler, Natalie, et autres
Publié: (2025)
The Robots are Here: Navigating the Generative AI Revolution in Computing Education
par: Prather, James, et autres
Publié: (2023)
par: Prather, James, et autres
Publié: (2023)
Mechanistic Interpretability of Socio-Political Frames in Language Models
par: Asghari, Hadi, et autres
Publié: (2025)
par: Asghari, Hadi, et autres
Publié: (2025)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
par: Zhang, Bang, et autres
Publié: (2025)
par: Zhang, Bang, et autres
Publié: (2025)
Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction
par: Basu, Sagnik, et autres
Publié: (2025)
par: Basu, Sagnik, et autres
Publié: (2025)
The Effects of Structured LLM-Generated Feedback on Programming Assignment Performance
par: Mihaylova, Tsvetomila, et autres
Publié: (2026)
par: Mihaylova, Tsvetomila, et autres
Publié: (2026)
Assessing the Reliability of Large Language Models in the Bengali Legal Context: A Comparative Evaluation Using LLM-as-Judge and Legal Experts
par: Aftahee, Sabik, et autres
Publié: (2025)
par: Aftahee, Sabik, et autres
Publié: (2025)
Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials
par: He, Peng, et autres
Publié: (2026)
par: He, Peng, et autres
Publié: (2026)
Generative AI for Education (GAIED): Advances, Opportunities, and Challenges
par: Denny, Paul, et autres
Publié: (2024)
par: Denny, Paul, et autres
Publié: (2024)
Howzat? Appealing to Expert Judgement for Evaluating Human and AI Next-Step Hints for Novice Programmers
par: Brown, Neil C. C., et autres
Publié: (2024)
par: Brown, Neil C. C., et autres
Publié: (2024)
Affective Computing and Emotional Data: Challenges and Implications in Privacy Regulations, The AI Act, and Ethics in Large Language Models
par: Fabiano, Nicola
Publié: (2025)
par: Fabiano, Nicola
Publié: (2025)
Potential and Perils of Large Language Models as Judges of Unstructured Textual Data
par: Bedemariam, Rewina, et autres
Publié: (2025)
par: Bedemariam, Rewina, et autres
Publié: (2025)
Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models
par: Raiyan, Syed Rifat
Publié: (2026)
par: Raiyan, Syed Rifat
Publié: (2026)
Documents similaires
-
Open Source Language Models Can Provide Feedback: Evaluating LLMs' Ability to Help Students Using GPT-4-As-A-Judge
par: Koutcheme, Charles, et autres
Publié: (2024) -
Benchmarking Educational Program Repair
par: Koutcheme, Charles, et autres
Publié: (2024) -
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
par: Koutcheme, Charles, et autres
Publié: (2026) -
Evaluating Contextually Personalized Programming Exercises Created with Generative AI
par: Logacheva, Evanfiya, et autres
Publié: (2024) -
On the Opportunities of Large Language Models for Programming Process Data
par: Edwards, John, et autres
Publié: (2024)