Open Source Language Models Can Provide Feedback: Evaluating LLMs' Ability to Help Students Using GPT-4-As-A-Judge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Koutcheme, Charles, Dainese, Nicola, Sarsa, Sami, Hellas, Arto, Leinonen, Juho, Denny, Paul |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Language Models for Generating and Judging Programming Feedback
par: Koutcheme, Charles, et autres
Publié: (2024)
par: Koutcheme, Charles, et autres
Publié: (2024)
Benchmarking Educational Program Repair
par: Koutcheme, Charles, et autres
Publié: (2024)
par: Koutcheme, Charles, et autres
Publié: (2024)
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
par: Koutcheme, Charles, et autres
Publié: (2026)
par: Koutcheme, Charles, et autres
Publié: (2026)
Evaluating Contextually Personalized Programming Exercises Created with Generative AI
par: Logacheva, Evanfiya, et autres
Publié: (2024)
par: Logacheva, Evanfiya, et autres
Publié: (2024)
AI-Generated Slides: Are They Good? Can Students Tell?
par: Leinonen, Juho, et autres
Publié: (2026)
par: Leinonen, Juho, et autres
Publié: (2026)
LLM-itation is the Sincerest Form of Data: Generating Synthetic Buggy Code Submissions for Computing Education
par: Leinonen, Juho, et autres
Publié: (2024)
par: Leinonen, Juho, et autres
Publié: (2024)
Comparing Code Explanations Created by Students and Large Language Models
par: Leinonen, Juho, et autres
Publié: (2023)
par: Leinonen, Juho, et autres
Publié: (2023)
"Like a Nesting Doll": Analyzing Recursion Analogies Generated by CS Students using Large Language Models
par: Bernstein, Seth, et autres
Publié: (2024)
par: Bernstein, Seth, et autres
Publié: (2024)
Using Large Language Models to Enhance Programming Error Messages
par: Leinonen, Juho, et autres
Publié: (2022)
par: Leinonen, Juho, et autres
Publié: (2022)
Let's Ask AI About Their Programs: Exploring ChatGPT's Answers To Program Comprehension Questions
par: Lehtinen, Teemu, et autres
Publié: (2024)
par: Lehtinen, Teemu, et autres
Publié: (2024)
Experiences from Integrating Large Language Model Chatbots into the Classroom
par: Hellas, Arto, et autres
Publié: (2024)
par: Hellas, Arto, et autres
Publié: (2024)
Synthetic Students: A Comparative Study of Bug Distribution Between Large Language Models and Computing Students
par: MacNeil, Stephen, et autres
Publié: (2024)
par: MacNeil, Stephen, et autres
Publié: (2024)
Comparing the Utility, Preference, and Performance of Course Material Search Functionality and Retrieval-Augmented Generation Large Language Model (RAG-LLM) AI Chatbots in Information-Seeking Tasks
par: Pasquarelli, Leonardo, et autres
Publié: (2024)
par: Pasquarelli, Leonardo, et autres
Publié: (2024)
On the Opportunities of Large Language Models for Programming Process Data
par: Edwards, John, et autres
Publié: (2024)
par: Edwards, John, et autres
Publié: (2024)
Narrowing the Gap: Supervised Fine-Tuning of Open-Source LLMs as a Viable Alternative to Proprietary Models for Pedagogical Tools
par: Solano, Lorenzo Lee, et autres
Publié: (2025)
par: Solano, Lorenzo Lee, et autres
Publié: (2025)
"Sometimes You Just Gotta Risk It for the Biscuit": A Portrait of Student Risk-Taking
par: Leinonen, Juho, et autres
Publié: (2024)
par: Leinonen, Juho, et autres
Publié: (2024)
Can We Improve Educational Diagram Generation with In-Context Examples? Not if a Hallucination Spoils the Bunch
par: Logacheva, Evanfiya, et autres
Publié: (2026)
par: Logacheva, Evanfiya, et autres
Publié: (2026)
Personalized Worked Example Generation from Student Code Submissions Using Pattern-based Knowledge Components
par: Pitts, Griffin, et autres
Publié: (2026)
par: Pitts, Griffin, et autres
Publié: (2026)
The Missing Evaluation Axis: What 10,000 Student Submissions Reveal About AI Tutor Effectiveness
par: Niousha, Rose, et autres
Publié: (2026)
par: Niousha, Rose, et autres
Publié: (2026)
Humanizing Automated Programming Feedback: Fine-Tuning Generative Models with Student-Written Feedback
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
The Effects of Structured LLM-Generated Feedback on Programming Assignment Performance
par: Mihaylova, Tsvetomila, et autres
Publié: (2026)
par: Mihaylova, Tsvetomila, et autres
Publié: (2026)
NEFMind: Parameter-Efficient Fine-Tuning of Open-Source LLMs for Telecom APIs Automation
par: Khan, Zainab, et autres
Publié: (2025)
par: Khan, Zainab, et autres
Publié: (2025)
Probing the Unknown: Exploring Student Interactions with Probeable Problems at Scale in Introductory Programming
par: Denny, Paul, et autres
Publié: (2025)
par: Denny, Paul, et autres
Publié: (2025)
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
par: Bao, Qiming, et autres
Publié: (2026)
par: Bao, Qiming, et autres
Publié: (2026)
Howzat? Appealing to Expert Judgement for Evaluating Human and AI Next-Step Hints for Novice Programmers
par: Brown, Neil C. C., et autres
Publié: (2024)
par: Brown, Neil C. C., et autres
Publié: (2024)
Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education
par: Jain, Mragisha, et autres
Publié: (2026)
par: Jain, Mragisha, et autres
Publié: (2026)
Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback
par: Rashkin, Hannah, et autres
Publié: (2025)
par: Rashkin, Hannah, et autres
Publié: (2025)
MiniLingua: A Small Open-Source LLM for European Languages
par: Aksenova, Anna, et autres
Publié: (2025)
par: Aksenova, Anna, et autres
Publié: (2025)
Overview of Web Application Performance Optimization Techniques
par: Vepsäläinen, Juho, et autres
Publié: (2024)
par: Vepsäläinen, Juho, et autres
Publié: (2024)
Explaining Code with a Purpose: An Integrated Approach for Developing Code Comprehension and Prompting Skills
par: Denny, Paul, et autres
Publié: (2024)
par: Denny, Paul, et autres
Publié: (2024)
Patterns of Student Help-Seeking When Using a Large Language Model-Powered Programming Assistant
par: Sheese, Brad, et autres
Publié: (2023)
par: Sheese, Brad, et autres
Publié: (2023)
When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition
par: Li, Karen Jia-Hui, et autres
Publié: (2025)
par: Li, Karen Jia-Hui, et autres
Publié: (2025)
Prompts First, Finally
par: Reeves, Brent N., et autres
Publié: (2024)
par: Reeves, Brent N., et autres
Publié: (2024)
The Open Source Resume: How Open Source Contributions Help Students Demonstrate Alignment with Employer Needs
par: Saha, Utsab, et autres
Publié: (2025)
par: Saha, Utsab, et autres
Publié: (2025)
Fast and Forgettable: A Controlled Study of Novices' Performance, Learning, Workload, and Emotion in AI-Assisted and Human Pair Programming Paradigms
par: Gardella, Nicholas, et autres
Publié: (2026)
par: Gardella, Nicholas, et autres
Publié: (2026)
How Large Language Models Are Changing MOOC Essay Answers: A Comparison of Pre- and Post-LLM Responses
par: Leppänen, Leo, et autres
Publié: (2025)
par: Leppänen, Leo, et autres
Publié: (2025)
Interleaving Natural Language Prompting with Code Editing for Solving Programming Tasks with Generative AI Models
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
par: Pădurean, Victor-Alexandru, et autres
Publié: (2025)
The Role of Generative AI in Software Student CollaborAItion
par: Kiesler, Natalie, et autres
Publié: (2025)
par: Kiesler, Natalie, et autres
Publié: (2025)
Can LLMs Reliably Simulate Real Students' Abilities in Mathematics and Reading Comprehension?
par: Srivatsa, KV Aditya, et autres
Publié: (2025)
par: Srivatsa, KV Aditya, et autres
Publié: (2025)
Can Open-Source LLMs Compete with Commercial Models? Exploring the Few-Shot Performance of Current GPT Models in Biomedical Tasks
par: Ateia, Samy, et autres
Publié: (2024)
par: Ateia, Samy, et autres
Publié: (2024)
Documents similaires
-
Evaluating Language Models for Generating and Judging Programming Feedback
par: Koutcheme, Charles, et autres
Publié: (2024) -
Benchmarking Educational Program Repair
par: Koutcheme, Charles, et autres
Publié: (2024) -
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
par: Koutcheme, Charles, et autres
Publié: (2026) -
Evaluating Contextually Personalized Programming Exercises Created with Generative AI
par: Logacheva, Evanfiya, et autres
Publié: (2024) -
AI-Generated Slides: Are They Good? Can Students Tell?
par: Leinonen, Juho, et autres
Publié: (2026)