A Large-Scale Real-World Evaluation of LLM-Based Virtual Teaching Assistant
Fuente:
arXiv
Saved in:
| Main Authors: | Kweon, Sunjun, Nam, Sooyohn, Lim, Hyunseung, Hong, Hwajung, Choi, Edward |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
by: Choi, Byungjin, et al.
Published: (2026)
by: Choi, Byungjin, et al.
Published: (2026)
Understanding Human-Multi-Agent Team Formation for Creative Work
by: Lim, Hyunseung, et al.
Published: (2026)
by: Lim, Hyunseung, et al.
Published: (2026)
Feed-O-Meter: Investigating AI-Generated Mentee Personas as Interactive Agents for Scaffolding Design Feedback Practice
by: Lim, Hyunseung, et al.
Published: (2025)
by: Lim, Hyunseung, et al.
Published: (2025)
Overview of the EHRSQL 2024 Shared Task on Reliable Text-to-SQL Modeling on Electronic Health Records
by: Lee, Gyubok, et al.
Published: (2024)
by: Lee, Gyubok, et al.
Published: (2024)
How Do Students Interact with an LLM-powered Virtual Teaching Assistant in Different Educational Settings?
by: Maiti, Pratyusha, et al.
Published: (2024)
by: Maiti, Pratyusha, et al.
Published: (2024)
PANORAMA: A Dataset and Benchmarks Capturing Decision Trails and Rationales in Patent Examination
by: Lim, Hyunseung, et al.
Published: (2025)
by: Lim, Hyunseung, et al.
Published: (2025)
Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant
by: Ballestero-Ribó, Marc, et al.
Published: (2025)
by: Ballestero-Ribó, Marc, et al.
Published: (2025)
A Knowledge-Component-Based Methodology for Evaluating AI Assistants
by: Qi, Laryn, et al.
Published: (2024)
by: Qi, Laryn, et al.
Published: (2024)
Identify Design Problems Through Questioning: Exploring Role-playing Interactions with Large Language Models to Foster Design Questioning Skills
by: Lim, Hyunseung, et al.
Published: (2024)
by: Lim, Hyunseung, et al.
Published: (2024)
Human or AI? Comparing Design Thinking Assessments by Teaching Assistants and Bots
by: Khan, Sumbul, et al.
Published: (2025)
by: Khan, Sumbul, et al.
Published: (2025)
REALM: A Dataset of Real-World LLM Use Cases
by: Cheng, Jingwen, et al.
Published: (2025)
by: Cheng, Jingwen, et al.
Published: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
by: Shi, Yuzhen, et al.
Published: (2026)
by: Shi, Yuzhen, et al.
Published: (2026)
Teaching at Scale: Leveraging AI to Evaluate and Elevate Engineering Education
by: Chamberland, Jean-Francois, et al.
Published: (2025)
by: Chamberland, Jean-Francois, et al.
Published: (2025)
Large Language Models as Misleading Assistants in Conversation
by: Hou, Betty Li, et al.
Published: (2024)
by: Hou, Betty Li, et al.
Published: (2024)
Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios
by: Choong, Yee-Yin, et al.
Published: (2026)
by: Choong, Yee-Yin, et al.
Published: (2026)
Reality Check: A New Evaluation Ecosystem Is Necessary to Understand AI's Real World Effects
by: Schwartz, Reva, et al.
Published: (2025)
by: Schwartz, Reva, et al.
Published: (2025)
Street-Level AI: Are Large Language Models Ready for Real-World Judgments?
by: Pokharel, Gaurab, et al.
Published: (2025)
by: Pokharel, Gaurab, et al.
Published: (2025)
Real Talk, Virtual Faces: Symbolic-Semantic Discourse Geometry of Virtual and Human Influencer Audiences
by: Chaudhry, Shahram, et al.
Published: (2026)
by: Chaudhry, Shahram, et al.
Published: (2026)
The Application of Virtual Environments and Artificial Intelligence in Higher Education: Experimental Findings in Philosophy Teaching
by: Vehrer, Adel, et al.
Published: (2025)
by: Vehrer, Adel, et al.
Published: (2025)
A GPU-Accelerated RAG-Based Telegram Assistant for Supporting Parallel Processing Students
by: Tel-Zur, Guy
Published: (2025)
by: Tel-Zur, Guy
Published: (2025)
Real-World AI Evaluation: How FRAME Generates Systematic Evidence to Resolve the Decision-Maker's Dilemma
by: Schwartz, Reva, et al.
Published: (2026)
by: Schwartz, Reva, et al.
Published: (2026)
An AI Teaching Assistant for Motion Picture Engineering
by: O'Regan, Deirdre, et al.
Published: (2026)
by: O'Regan, Deirdre, et al.
Published: (2026)
Benefits and Risks of Using ChatGPT4 as a Teaching Assistant for Computer Science Students
by: Aragonés-Soria, Yaiza, et al.
Published: (2024)
by: Aragonés-Soria, Yaiza, et al.
Published: (2024)
When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition
by: Li, Karen Jia-Hui, et al.
Published: (2025)
by: Li, Karen Jia-Hui, et al.
Published: (2025)
Generative AI and Power Imbalances in Global Education: Frameworks for Bias Mitigation
by: Nyaaba, Matthew, et al.
Published: (2024)
by: Nyaaba, Matthew, et al.
Published: (2024)
Who's in Charge? Disempowerment Patterns in Real-World LLM Usage
by: Sharma, Mrinank, et al.
Published: (2026)
by: Sharma, Mrinank, et al.
Published: (2026)
Reconciling Methodological Paradigms: Employing Large Language Models as Novice Qualitative Research Assistants in Talent Management Research
by: Bhaduri, Sreyoshi, et al.
Published: (2024)
by: Bhaduri, Sreyoshi, et al.
Published: (2024)
Suitability Filter: A Statistical Framework for Classifier Evaluation in Real-World Deployment Settings
by: Pouget, Angéline, et al.
Published: (2025)
by: Pouget, Angéline, et al.
Published: (2025)
Can AI be a Teaching Partner? Evaluating ChatGPT, Gemini, and DeepSeek across Three Teaching Strategies
by: de Souza, Talita de Paula Cypriano, et al.
Published: (2026)
by: de Souza, Talita de Paula Cypriano, et al.
Published: (2026)
Could ChatGPT get an Engineering Degree? Evaluating Higher Education Vulnerability to AI Assistants
by: Borges, Beatriz, et al.
Published: (2024)
by: Borges, Beatriz, et al.
Published: (2024)
Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
by: Jiang, Roy, et al.
Published: (2026)
by: Jiang, Roy, et al.
Published: (2026)
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
by: Patwardhan, Tejal, et al.
Published: (2025)
by: Patwardhan, Tejal, et al.
Published: (2025)
AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy
by: Schoenegger, Philipp, et al.
Published: (2024)
by: Schoenegger, Philipp, et al.
Published: (2024)
LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluation
by: Ghosh, Himel, et al.
Published: (2026)
by: Ghosh, Himel, et al.
Published: (2026)
Assessing the Reliability of Large Language Models in the Bengali Legal Context: A Comparative Evaluation Using LLM-as-Judge and Legal Experts
by: Aftahee, Sabik, et al.
Published: (2025)
by: Aftahee, Sabik, et al.
Published: (2025)
SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant
by: Zhang, Yifan, et al.
Published: (2026)
by: Zhang, Yifan, et al.
Published: (2026)
EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions
by: Sun, Weiyu, et al.
Published: (2026)
by: Sun, Weiyu, et al.
Published: (2026)
An Evaluation of Cultural Value Alignment in LLM
by: Sukiennik, Nicholas, et al.
Published: (2025)
by: Sukiennik, Nicholas, et al.
Published: (2025)
Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards
by: Jung, Minji, et al.
Published: (2026)
by: Jung, Minji, et al.
Published: (2026)
Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents
by: Zhang, Chenyu, et al.
Published: (2025)
by: Zhang, Chenyu, et al.
Published: (2025)
Similar Items
-
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
by: Choi, Byungjin, et al.
Published: (2026) -
Understanding Human-Multi-Agent Team Formation for Creative Work
by: Lim, Hyunseung, et al.
Published: (2026) -
Feed-O-Meter: Investigating AI-Generated Mentee Personas as Interactive Agents for Scaffolding Design Feedback Practice
by: Lim, Hyunseung, et al.
Published: (2025) -
Overview of the EHRSQL 2024 Shared Task on Reliable Text-to-SQL Modeling on Electronic Health Records
by: Lee, Gyubok, et al.
Published: (2024) -
How Do Students Interact with an LLM-powered Virtual Teaching Assistant in Different Educational Settings?
by: Maiti, Pratyusha, et al.
Published: (2024)