EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Weiyu, Chen, Liangliang, Cai, Yongnuo, Xie, Huiru, Zeng, Yi, Zhang, Ying |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving
by: Chen, Liangliang, et al.
Published: (2025)
by: Chen, Liangliang, et al.
Published: (2025)
WIP: Large Language Model-Enhanced Smart Tutor for Undergraduate Circuit Analysis
by: Chen, Liangliang, et al.
Published: (2025)
by: Chen, Liangliang, et al.
Published: (2025)
Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis
by: Chen, Liangliang, et al.
Published: (2025)
by: Chen, Liangliang, et al.
Published: (2025)
HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark
by: Pal, Aniket, et al.
Published: (2025)
by: Pal, Aniket, et al.
Published: (2025)
Grading Handwritten Engineering Exams with Multimodal Large Language Models
by: Perš, Janez, et al.
Published: (2026)
by: Perš, Janez, et al.
Published: (2026)
Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams
by: Caraeni, Adriana, et al.
Published: (2024)
by: Caraeni, Adriana, et al.
Published: (2024)
UniEDU: A Unified Language and Vision Assistant for Education Applications
by: Chu, Zhendong, et al.
Published: (2025)
by: Chu, Zhendong, et al.
Published: (2025)
Can Vision-Language Models Evaluate Handwritten Math?
by: Nath, Oikantik, et al.
Published: (2025)
by: Nath, Oikantik, et al.
Published: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
by: Hong, Jack, et al.
Published: (2025)
by: Hong, Jack, et al.
Published: (2025)
Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math
by: Song, Dingjie, et al.
Published: (2026)
by: Song, Dingjie, et al.
Published: (2026)
Advancing Question Answering on Handwritten Documents: A State-of-the-Art Recognition-Based Model for HW-SQuAD
by: Pal, Aniket, et al.
Published: (2024)
by: Pal, Aniket, et al.
Published: (2024)
Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work
by: Henkel, Owen, et al.
Published: (2025)
by: Henkel, Owen, et al.
Published: (2025)
Pensieve Grader: An AI-Powered, Ready-to-Use Platform for Effortless Handwritten STEM Grading
by: Yang, Yoonseok, et al.
Published: (2025)
by: Yang, Yoonseok, et al.
Published: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
by: Qiu, Lu, et al.
Published: (2024)
by: Qiu, Lu, et al.
Published: (2024)
MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation
by: Xue, Haochen, et al.
Published: (2025)
by: Xue, Haochen, et al.
Published: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
by: Chen, Yi, et al.
Published: (2023)
by: Chen, Yi, et al.
Published: (2023)
Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work
by: Kim, Yoonsu, et al.
Published: (2025)
by: Kim, Yoonsu, et al.
Published: (2025)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
Benchmarking Large Language Models for Handwritten Text Recognition
by: Crosilla, Giorgia, et al.
Published: (2025)
by: Crosilla, Giorgia, et al.
Published: (2025)
ESURF: Simple and Effective EDU Segmentation
by: Sediqin, Mohammadreza, et al.
Published: (2025)
by: Sediqin, Mohammadreza, et al.
Published: (2025)
Visual Expansion and Real‐Time Calibration for Pan‐Tilt‐Zoom Cameras Assisted by Panoramic Models
by: Liangliang Cai, et al.
Published: (2025)
by: Liangliang Cai, et al.
Published: (2025)
Multimodal Large Language Models to Support Real-World Fact-Checking
by: Geng, Jiahui, et al.
Published: (2024)
by: Geng, Jiahui, et al.
Published: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
by: Yang, Shuo, et al.
Published: (2025)
by: Yang, Shuo, et al.
Published: (2025)
Evaluation of Large Language Models: STEM education and Gender Stereotypes
by: Due, Smilla, et al.
Published: (2024)
by: Due, Smilla, et al.
Published: (2024)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
by: You, Liangliang, et al.
Published: (2025)
by: You, Liangliang, et al.
Published: (2025)
Street-Level AI: Are Large Language Models Ready for Real-World Judgments?
by: Pokharel, Gaurab, et al.
Published: (2025)
by: Pokharel, Gaurab, et al.
Published: (2025)
Evaluating Large Language Models for Real-World Engineering Tasks
by: Heesch, Rene, et al.
Published: (2025)
by: Heesch, Rene, et al.
Published: (2025)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
by: Zhang, YiFan, et al.
Published: (2024)
by: Zhang, YiFan, et al.
Published: (2024)
The Future of Learning: Large Language Models through the Lens of Students
by: Zhang, He, et al.
Published: (2024)
by: Zhang, He, et al.
Published: (2024)
EDU Focus: Valuing Differences and Working Together Now.
by: Trocchi, Robert F.
Published: (1987)
by: Trocchi, Robert F.
Published: (1987)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
by: Jin, Jing, et al.
Published: (2026)
by: Jin, Jing, et al.
Published: (2026)
Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents
by: Humphries, Mark, et al.
Published: (2024)
by: Humphries, Mark, et al.
Published: (2024)
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
VEHME: A Vision-Language Model For Evaluating Handwritten Mathematics Expressions
by: Nguyen, Thu Phuong, et al.
Published: (2025)
by: Nguyen, Thu Phuong, et al.
Published: (2025)
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
by: Waly, Alhossien, et al.
Published: (2025)
by: Waly, Alhossien, et al.
Published: (2025)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
by: Wu, Yifan, et al.
Published: (2024)
by: Wu, Yifan, et al.
Published: (2024)
Inequalities in Computational Thinking Among Incoming Students in an STEM Chilean University
by: González-Pizarro, Felipe, et al.
Published: (2024)
by: González-Pizarro, Felipe, et al.
Published: (2024)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
by: Cheng, Xianfu, et al.
Published: (2025)
by: Cheng, Xianfu, et al.
Published: (2025)
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
by: Radwan, Ahmed Y., et al.
Published: (2026)
by: Radwan, Ahmed Y., et al.
Published: (2026)
When VLMs 'Fix' Students: Identifying and Penalizing Over-Correction in the Evaluation of Multi-line Handwritten Math OCR
by: Seong, Jin, et al.
Published: (2026)
by: Seong, Jin, et al.
Published: (2026)
Similar Items
-
Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving
by: Chen, Liangliang, et al.
Published: (2025) -
WIP: Large Language Model-Enhanced Smart Tutor for Undergraduate Circuit Analysis
by: Chen, Liangliang, et al.
Published: (2025) -
Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis
by: Chen, Liangliang, et al.
Published: (2025) -
HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark
by: Pal, Aniket, et al.
Published: (2025) -
Grading Handwritten Engineering Exams with Multimodal Large Language Models
by: Perš, Janez, et al.
Published: (2026)