EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research
Fuente:
arXiv
Guardado en:
| Autores principales: | Yue, Houping, Di, Zixiang, Jiang, Mei, Li, Bingdong, Hao, Hao, Song, Yu, Jiang, Bo, Zhou, Aimin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
por: Jiang, Mei, et al.
Publicado: (2025)
por: Jiang, Mei, et al.
Publicado: (2025)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
por: Zhang, Min, et al.
Publicado: (2025)
por: Zhang, Min, et al.
Publicado: (2025)
A First Look at Kolmogorov-Arnold Networks in Surrogate-assisted Evolutionary Algorithms
por: Hao, Hao, et al.
Publicado: (2024)
por: Hao, Hao, et al.
Publicado: (2024)
Relation Reasoning with LLMs in Expensive Optimization
por: Lu, Ye, et al.
Publicado: (2026)
por: Lu, Ye, et al.
Publicado: (2026)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
por: Wang, Shuai, et al.
Publicado: (2026)
por: Wang, Shuai, et al.
Publicado: (2026)
It's Morphing Time: Unleashing the Potential of Multiple LLMs via Multi-objective Optimization
por: Li, Bingdong, et al.
Publicado: (2024)
por: Li, Bingdong, et al.
Publicado: (2024)
Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network
por: Li, Bingdong, et al.
Publicado: (2025)
por: Li, Bingdong, et al.
Publicado: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
por: Liu, Yujie, et al.
Publicado: (2025)
por: Liu, Yujie, et al.
Publicado: (2025)
Evolutionary Reinforcement Learning based AI tutor for Socratic Interdisciplinary Instruction
por: Jiang, Mei, et al.
Publicado: (2025)
por: Jiang, Mei, et al.
Publicado: (2025)
Expensive Multi-Objective Bayesian Optimization Based on Diffusion Models
por: Li, Bingdong, et al.
Publicado: (2024)
por: Li, Bingdong, et al.
Publicado: (2024)
Context-aware Diversity Enhancement for Neural Multi-Objective Combinatorial Optimization
por: Lu, Yongfan, et al.
Publicado: (2024)
por: Lu, Yongfan, et al.
Publicado: (2024)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
por: Li, Ruijia, et al.
Publicado: (2026)
por: Li, Ruijia, et al.
Publicado: (2026)
EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content
por: Bi, Shuzhen, et al.
Publicado: (2026)
por: Bi, Shuzhen, et al.
Publicado: (2026)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
por: Ma, Guoqing, et al.
Publicado: (2025)
por: Ma, Guoqing, et al.
Publicado: (2025)
ORCDF: An Oversmoothing-Resistant Cognitive Diagnosis Framework for Student Learning in Online Education Systems
por: Qian, Hong, et al.
Publicado: (2024)
por: Qian, Hong, et al.
Publicado: (2024)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
por: Jiang, Yilin, et al.
Publicado: (2025)
por: Jiang, Yilin, et al.
Publicado: (2025)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
por: Xu, Bin, et al.
Publicado: (2025)
por: Xu, Bin, et al.
Publicado: (2025)
OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents
por: Zhou, Chenyu, et al.
Publicado: (2026)
por: Zhou, Chenyu, et al.
Publicado: (2026)
Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench
por: Li, Dinghao, et al.
Publicado: (2026)
por: Li, Dinghao, et al.
Publicado: (2026)
AutoSci: A Memory-Centric Agentic System for the Full Scientific Research Lifecycle
por: Qian, Weitong, et al.
Publicado: (2026)
por: Qian, Weitong, et al.
Publicado: (2026)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
por: Ji, Haonian, et al.
Publicado: (2025)
por: Ji, Haonian, et al.
Publicado: (2025)
Figueira Cheese‐Inspired Hierarchical Nanocomposites: Combining Ultralow Percolation and Breathability Toward Full‐Lifecycle Circular Epidermal Electronics
por: Kangjia Geng, et al.
Publicado: (2026)
por: Kangjia Geng, et al.
Publicado: (2026)
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
por: Lei, Fangyu, et al.
Publicado: (2025)
por: Lei, Fangyu, et al.
Publicado: (2025)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents
por: Zhu, Buyuan, et al.
Publicado: (2025)
por: Zhu, Buyuan, et al.
Publicado: (2025)
Un-evaluated Solutions May Be Valuable in Expensive Optimization
por: Hao, Hao, et al.
Publicado: (2024)
por: Hao, Hao, et al.
Publicado: (2024)
Large Language Models as Surrogate Models in Evolutionary Algorithms: A Preliminary Study
por: Hao, Hao, et al.
Publicado: (2024)
por: Hao, Hao, et al.
Publicado: (2024)
Model Uncertainty in Evolutionary Optimization and Bayesian Optimization: A Comparative Analysis
por: Hao, Hao, et al.
Publicado: (2024)
por: Hao, Hao, et al.
Publicado: (2024)
Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation
por: Lee, Unggi, et al.
Publicado: (2026)
por: Lee, Unggi, et al.
Publicado: (2026)
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
por: Wei, Shou'ang, et al.
Publicado: (2025)
por: Wei, Shou'ang, et al.
Publicado: (2025)
EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms
por: Liu, WenTao, et al.
Publicado: (2025)
por: Liu, WenTao, et al.
Publicado: (2025)
Agent4Edu: Generating Learner Response Data by Generative Agents for Intelligent Education Systems
por: Gao, Weibo, et al.
Publicado: (2025)
por: Gao, Weibo, et al.
Publicado: (2025)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
por: Xiong, Lei, et al.
Publicado: (2026)
por: Xiong, Lei, et al.
Publicado: (2026)
Scaling Laws for Educational AI Agents
por: Wu, Mengsong, et al.
Publicado: (2026)
por: Wu, Mengsong, et al.
Publicado: (2026)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
por: Jin, Song, et al.
Publicado: (2026)
por: Jin, Song, et al.
Publicado: (2026)
EduRABSA: An Education Review Dataset for Aspect-based Sentiment Analysis Tasks
por: Hua, Yan Cathy, et al.
Publicado: (2025)
por: Hua, Yan Cathy, et al.
Publicado: (2025)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
por: Huang, Peizhou, et al.
Publicado: (2026)
por: Huang, Peizhou, et al.
Publicado: (2026)
CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks
por: Jiang, Hongchao, et al.
Publicado: (2025)
por: Jiang, Hongchao, et al.
Publicado: (2025)
Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations
por: Zhang, Yifei, et al.
Publicado: (2023)
por: Zhang, Yifei, et al.
Publicado: (2023)
Ejemplares similares
-
SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
por: Jiang, Mei, et al.
Publicado: (2025) -
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
por: Zhang, Min, et al.
Publicado: (2025) -
A First Look at Kolmogorov-Arnold Networks in Surrogate-assisted Evolutionary Algorithms
por: Hao, Hao, et al.
Publicado: (2024) -
Relation Reasoning with LLMs in Expensive Optimization
por: Lu, Ye, et al.
Publicado: (2026) -
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
por: Wang, Shuai, et al.
Publicado: (2026)