ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Shou'ang, Wang, Xinyun, Bi, Shuzhen, Chen, Jian, Li, Ruijia, Jiang, Bo, Lin, Xin, Zhang, Min, Song, Yu, Li, BingDong, Zhou, Aimin, Hao, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content
di: Bi, Shuzhen, et al.
Pubblicazione: (2026)
di: Bi, Shuzhen, et al.
Pubblicazione: (2026)
AutoSynth: Automated Workflow Optimization for High-Quality Synthetic Dataset Generation via Monte Carlo Tree Search
di: Bi, Shuzhen, et al.
Pubblicazione: (2025)
di: Bi, Shuzhen, et al.
Pubblicazione: (2025)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
DiaCDM: Cognitive Diagnosis in Teacher-Student Dialogues using the Initiation-Response-Evaluation Framework
di: Jia, Rui, et al.
Pubblicazione: (2025)
di: Jia, Rui, et al.
Pubblicazione: (2025)
CoupNeRF: Property‐aware Neural Radiance Fields for Multi‐Material Coupled Scenario Reconstruction
di: Jin Li, et al.
Pubblicazione: (2024)
di: Jin Li, et al.
Pubblicazione: (2024)
EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus
di: Wei, Shouang, et al.
Pubblicazione: (2025)
di: Wei, Shouang, et al.
Pubblicazione: (2025)
Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction
di: Bi, Shuzhen, et al.
Pubblicazione: (2026)
di: Bi, Shuzhen, et al.
Pubblicazione: (2026)
EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research
di: Yue, Houping, et al.
Pubblicazione: (2026)
di: Yue, Houping, et al.
Pubblicazione: (2026)
Agentic Workflow for Education: Concepts and Applications
di: Jiang, Yuan-Hao, et al.
Pubblicazione: (2025)
di: Jiang, Yuan-Hao, et al.
Pubblicazione: (2025)
AI Agent for Education: von Neumann Multi-Agent System Framework
di: Jiang, Yuan-Hao, et al.
Pubblicazione: (2024)
di: Jiang, Yuan-Hao, et al.
Pubblicazione: (2024)
Thinking in Graphs with CoMAP: A Shared Visual Workspace for Designing Project-Based Learning
di: Li, Ruijia, et al.
Pubblicazione: (2026)
di: Li, Ruijia, et al.
Pubblicazione: (2026)
Scaling Laws for Educational AI Agents
di: Wu, Mengsong, et al.
Pubblicazione: (2026)
di: Wu, Mengsong, et al.
Pubblicazione: (2026)
How Real Is AI Tutoring? Comparing Simulated and Human Dialogues in One-on-One Instruction
di: Li, Ruijia, et al.
Pubblicazione: (2025)
di: Li, Ruijia, et al.
Pubblicazione: (2025)
A First Look at Kolmogorov-Arnold Networks in Surrogate-assisted Evolutionary Algorithms
di: Hao, Hao, et al.
Pubblicazione: (2024)
di: Hao, Hao, et al.
Pubblicazione: (2024)
Relation Reasoning with LLMs in Expensive Optimization
di: Lu, Ye, et al.
Pubblicazione: (2026)
di: Lu, Ye, et al.
Pubblicazione: (2026)
Un-evaluated Solutions May Be Valuable in Expensive Optimization
di: Hao, Hao, et al.
Pubblicazione: (2024)
di: Hao, Hao, et al.
Pubblicazione: (2024)
Large Language Models as Surrogate Models in Evolutionary Algorithms: A Preliminary Study
di: Hao, Hao, et al.
Pubblicazione: (2024)
di: Hao, Hao, et al.
Pubblicazione: (2024)
Model Uncertainty in Evolutionary Optimization and Bayesian Optimization: A Comparative Analysis
di: Hao, Hao, et al.
Pubblicazione: (2024)
di: Hao, Hao, et al.
Pubblicazione: (2024)
PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model
di: Gao, Mingju, et al.
Pubblicazione: (2025)
di: Gao, Mingju, et al.
Pubblicazione: (2025)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
di: Li, Ruijia, et al.
Pubblicazione: (2026)
di: Li, Ruijia, et al.
Pubblicazione: (2026)
ORCDF: An Oversmoothing-Resistant Cognitive Diagnosis Framework for Student Learning in Online Education Systems
di: Qian, Hong, et al.
Pubblicazione: (2024)
di: Qian, Hong, et al.
Pubblicazione: (2024)
DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
CRUISE: Cooperative Reconstruction and Editing in V2X Scenarios using Gaussian Splatting
di: Xu, Haoran, et al.
Pubblicazione: (2025)
di: Xu, Haoran, et al.
Pubblicazione: (2025)
SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis
di: Gao, Huan-ang, et al.
Pubblicazione: (2024)
di: Gao, Huan-ang, et al.
Pubblicazione: (2024)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
di: Yu, Qingchen, et al.
Pubblicazione: (2024)
di: Yu, Qingchen, et al.
Pubblicazione: (2024)
SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation
di: Jiang, Lai, et al.
Pubblicazione: (2025)
di: Jiang, Lai, et al.
Pubblicazione: (2025)
HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models
di: Liu, Xinyun
Pubblicazione: (2026)
di: Liu, Xinyun
Pubblicazione: (2026)
EduVerse: A User-Defined Multi-Agent Simulation Space for Education Scenario
di: Ma, Yiping, et al.
Pubblicazione: (2025)
di: Ma, Yiping, et al.
Pubblicazione: (2025)
Colorectal Polyp Segmentation in the Deep Learning Era: A Comprehensive Survey
di: Wu, Zhenyu, et al.
Pubblicazione: (2024)
di: Wu, Zhenyu, et al.
Pubblicazione: (2024)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
di: Xu, Bin, et al.
Pubblicazione: (2025)
di: Xu, Bin, et al.
Pubblicazione: (2025)
Agentic AI for Particle-Based Simulation: Automating SPH Workflows for Debris Flow Modeling
di: Zhang, Danrong, et al.
Pubblicazione: (2026)
di: Zhang, Danrong, et al.
Pubblicazione: (2026)
Dual-frame Fluid Motion Estimation with Test-time Optimization and Zero-divergence Loss
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
di: Zhang, Yifei, et al.
Pubblicazione: (2024)
HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
di: Mazeika, Mantas, et al.
Pubblicazione: (2024)
It's Morphing Time: Unleashing the Potential of Multiple LLMs via Multi-objective Optimization
di: Li, Bingdong, et al.
Pubblicazione: (2024)
di: Li, Bingdong, et al.
Pubblicazione: (2024)
A Generic and Automated Methodology to Simulate Melting Point
di: Dai, Fu-Zhi, et al.
Pubblicazione: (2024)
di: Dai, Fu-Zhi, et al.
Pubblicazione: (2024)
APE-Bench: Evaluating Automated Proof Engineering for Formal Math Libraries
di: Xin, Huajian, et al.
Pubblicazione: (2025)
di: Xin, Huajian, et al.
Pubblicazione: (2025)
RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework
di: Zhu, Kunlun, et al.
Pubblicazione: (2024)
di: Zhu, Kunlun, et al.
Pubblicazione: (2024)
SmartRefine: A Scenario-Adaptive Refinement Framework for Efficient Motion Prediction
di: Zhou, Yang, et al.
Pubblicazione: (2024)
di: Zhou, Yang, et al.
Pubblicazione: (2024)
ChatSUMO: Large Language Model for Automating Traffic Scenario Generation in Simulation of Urban MObility
di: Li, Shuyang, et al.
Pubblicazione: (2024)
di: Li, Shuyang, et al.
Pubblicazione: (2024)
When LLMs Learn to be Students: The SOEI Framework for Modeling and Evaluating Virtual Student Agents in Educational Interaction
di: Ma, Yiping, et al.
Pubblicazione: (2024)
di: Ma, Yiping, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content
di: Bi, Shuzhen, et al.
Pubblicazione: (2026) -
AutoSynth: Automated Workflow Optimization for High-Quality Synthetic Dataset Generation via Monte Carlo Tree Search
di: Bi, Shuzhen, et al.
Pubblicazione: (2025) -
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025) -
DiaCDM: Cognitive Diagnosis in Teacher-Student Dialogues using the Initiation-Response-Evaluation Framework
di: Jia, Rui, et al.
Pubblicazione: (2025) -
CoupNeRF: Property‐aware Neural Radiance Fields for Multi‐Material Coupled Scenario Reconstruction
di: Jin Li, et al.
Pubblicazione: (2024)