E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hou, Jinchang, Ao, Chang, Wu, Haihong, Kong, Xiangtao, Zheng, Zhigang, Tang, Daijia, Li, Chengming, Hu, Xiping, Xu, Ruifeng, Ni, Shiwen, Yang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training on the Benchmark Is Not All You Need
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
Layer-wise Regularized Dropout for Neural Language Models
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
di: Ni, Shiwen, et al.
Pubblicazione: (2023)
di: Ni, Shiwen, et al.
Pubblicazione: (2023)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
CLHA: A Simple yet Effective Contrastive Learning Framework for Human Alignment
di: Fang, Feiteng, et al.
Pubblicazione: (2024)
di: Fang, Feiteng, et al.
Pubblicazione: (2024)
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
di: Wang, Dong
Pubblicazione: (2025)
di: Wang, Dong
Pubblicazione: (2025)
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
di: Wei, Yuting, et al.
Pubblicazione: (2024)
di: Wei, Yuting, et al.
Pubblicazione: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
Educational-Psychological Dialogue Robot Based on Multi-Agent Collaboration
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
CPsyExam: A Chinese Benchmark for Evaluating Psychology using Examinations
di: Zhao, Jiahao, et al.
Pubblicazione: (2024)
di: Zhao, Jiahao, et al.
Pubblicazione: (2024)
A Survey on Large Language Model Benchmarks
di: Ni, Shiwen, et al.
Pubblicazione: (2025)
di: Ni, Shiwen, et al.
Pubblicazione: (2025)
Small Language Model as Data Prospector for Large Language Model
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
di: Ning, Kangyun, et al.
Pubblicazione: (2024)
di: Ning, Kangyun, et al.
Pubblicazione: (2024)
OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
di: Zhu, Wenhong, et al.
Pubblicazione: (2023)
di: Zhu, Wenhong, et al.
Pubblicazione: (2023)
Lower Layers Matter: Alleviating Hallucination via Multi-Layer Fusion Contrastive Decoding with Truthfulness Refocused
di: Chen, Dingwei, et al.
Pubblicazione: (2024)
di: Chen, Dingwei, et al.
Pubblicazione: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
di: Qiu, Haoyi, et al.
Pubblicazione: (2024)
di: Qiu, Haoyi, et al.
Pubblicazione: (2024)
Enhancing Noise Robustness of Retrieval-Augmented Language Models with Adaptive Adversarial Training
di: Fang, Feiteng, et al.
Pubblicazione: (2024)
di: Fang, Feiteng, et al.
Pubblicazione: (2024)
CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling
di: Zhang, Chenhao, et al.
Pubblicazione: (2024)
di: Zhang, Chenhao, et al.
Pubblicazione: (2024)
Quantification of Large Language Model Distillation
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
EduEVAL-DB: A Role-Based Dataset for Pedagogical Risk Evaluation in Educational Explanations
di: Irigoyen, Javier, et al.
Pubblicazione: (2026)
di: Irigoyen, Javier, et al.
Pubblicazione: (2026)
Expression Syntax Information Bottleneck for Math Word Problems
di: Xiong, Jing, et al.
Pubblicazione: (2023)
di: Xiong, Jing, et al.
Pubblicazione: (2023)
Self-consistent Reasoning For Solving Math Word Problems
di: Xiong, Jing, et al.
Pubblicazione: (2022)
di: Xiong, Jing, et al.
Pubblicazione: (2022)
Evaluating Front-end & Back-end of Human Automation Interaction Applications Δ-EVAL A Hypothetical Benchmark
di: de Carvalho, Gonçalo Hora
Pubblicazione: (2024)
di: de Carvalho, Gonçalo Hora
Pubblicazione: (2024)
IQA-EVAL: Automatic Evaluation of Human-Model Interactive Question Answering
di: Li, Ruosen, et al.
Pubblicazione: (2024)
di: Li, Ruosen, et al.
Pubblicazione: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description
di: Mo, Jiawei, et al.
Pubblicazione: (2024)
di: Mo, Jiawei, et al.
Pubblicazione: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
di: Yan, Lian, et al.
Pubblicazione: (2025)
di: Yan, Lian, et al.
Pubblicazione: (2025)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
Pre-training, Fine-tuning and Re-ranking: A Three-Stage Framework for Legal Question Answering
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
FedPall: Prototype-based Adversarial and Collaborative Learning for Federated Learning with Feature Drift
di: Zhang, Yong, et al.
Pubblicazione: (2025)
di: Zhang, Yong, et al.
Pubblicazione: (2025)
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
di: Chen, Dingwei, et al.
Pubblicazione: (2025)
di: Chen, Dingwei, et al.
Pubblicazione: (2025)
Evaluating Nutrition Education in K‐12 Schools: A Comprehensive Review 2024
di: Nathalie Lissain, et al.
Pubblicazione: (2026)
di: Nathalie Lissain, et al.
Pubblicazione: (2026)
NEXT-EVAL: Next Evaluation of Traditional and LLM Web Data Record Extraction
di: Kim, Soyeon, et al.
Pubblicazione: (2025)
di: Kim, Soyeon, et al.
Pubblicazione: (2025)
GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration
di: Kong, Xiangtao, et al.
Pubblicazione: (2026)
di: Kong, Xiangtao, et al.
Pubblicazione: (2026)
DeliLaw: A Chinese Legal Counselling System Based on a Large Language Model
di: Xie, Nan, et al.
Pubblicazione: (2024)
di: Xie, Nan, et al.
Pubblicazione: (2024)
Towards Effective Multiple-in-One Image Restoration: A Sequential and Prompt Learning Strategy
di: Kong, Xiangtao, et al.
Pubblicazione: (2024)
di: Kong, Xiangtao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Training on the Benchmark Is Not All You Need
di: Ni, Shiwen, et al.
Pubblicazione: (2024) -
Layer-wise Regularized Dropout for Neural Language Models
di: Ni, Shiwen, et al.
Pubblicazione: (2024) -
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
di: Ni, Shiwen, et al.
Pubblicazione: (2023) -
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
di: Ni, Shiwen, et al.
Pubblicazione: (2024) -
CLHA: A Simple yet Effective Contrastive Learning Framework for Human Alignment
di: Fang, Feiteng, et al.
Pubblicazione: (2024)