Evaluating the Performance of Large Language Models on GAOKAO Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xiaotian, Li, Chunyang, Zong, Yi, Ying, Zhengyu, He, Liang, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
par: Zong, Yi, et autres
Publié: (2024)
par: Zong, Yi, et autres
Publié: (2024)
GAOKAO-Eval: Does high scores truly reflect strong capabilities in LLMs?
par: Lei, Zhikai, et autres
Publié: (2024)
par: Lei, Zhikai, et autres
Publié: (2024)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
par: Chen, Kedi, et autres
Publié: (2024)
par: Chen, Kedi, et autres
Publié: (2024)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
par: Jiang, Botian, et autres
Publié: (2024)
par: Jiang, Botian, et autres
Publié: (2024)
MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
par: Zong, Xuanjun, et autres
Publié: (2025)
par: Zong, Xuanjun, et autres
Publié: (2025)
Evolution of Concepts in Language Model Pre-Training
par: Ge, Xuyang, et autres
Publié: (2025)
par: Ge, Xuyang, et autres
Publié: (2025)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
par: Jiang, Jiyue, et autres
Publié: (2025)
par: Jiang, Jiyue, et autres
Publié: (2025)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning
par: Luo, Qi, et autres
Publié: (2025)
par: Luo, Qi, et autres
Publié: (2025)
MAPO: Boosting Large Language Model Performance with Model-Adaptive Prompt Optimization
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark
par: Li, Zheqing, et autres
Publié: (2025)
par: Li, Zheqing, et autres
Publié: (2025)
Balanced Data Sampling for Language Model Training with Clustering
par: Shao, Yunfan, et autres
Publié: (2024)
par: Shao, Yunfan, et autres
Publié: (2024)
DeepJSONEval: Benchmarking Complex Nested JSON Data Mining for Large Language Models
par: Zhou, Zhicheng, et autres
Publié: (2025)
par: Zhou, Zhicheng, et autres
Publié: (2025)
Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance
par: Ye, Jiasheng, et autres
Publié: (2024)
par: Ye, Jiasheng, et autres
Publié: (2024)
Evaluating Psychological Safety of Large Language Models
par: Li, Xingxuan, et autres
Publié: (2022)
par: Li, Xingxuan, et autres
Publié: (2022)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
par: Zhang, Xiaotian, et autres
Publié: (2025)
par: Zhang, Xiaotian, et autres
Publié: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
par: Zou, Xiaotian, et autres
Publié: (2024)
par: Zou, Xiaotian, et autres
Publié: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
par: Yang, Shuo, et autres
Publié: (2025)
par: Yang, Shuo, et autres
Publié: (2025)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
par: Ni, Shiwen, et autres
Publié: (2024)
par: Ni, Shiwen, et autres
Publié: (2024)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023)
par: Fu, Lingyue, et autres
Publié: (2023)
GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
par: Zhu, Jie, et autres
Publié: (2024)
par: Zhu, Jie, et autres
Publié: (2024)
MVPBench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values
par: Liang, Yao, et autres
Publié: (2025)
par: Liang, Yao, et autres
Publié: (2025)
Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems
par: Cui, Tianyu, et autres
Publié: (2024)
par: Cui, Tianyu, et autres
Publié: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
par: Huang, Pengcheng, et autres
Publié: (2024)
par: Huang, Pengcheng, et autres
Publié: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
par: Xu, Hainiu, et autres
Publié: (2024)
par: Xu, Hainiu, et autres
Publié: (2024)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
par: Hu, Wenhao, et autres
Publié: (2025)
par: Hu, Wenhao, et autres
Publié: (2025)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
par: Peng, Runyu, et autres
Publié: (2026)
par: Peng, Runyu, et autres
Publié: (2026)
Evaluating Ill-Defined Tasks in Large Language Models
par: Zhou, Yi, et autres
Publié: (2026)
par: Zhou, Yi, et autres
Publié: (2026)
Importance Weighting Can Help Large Language Models Self-Improve
par: Jiang, Chunyang, et autres
Publié: (2024)
par: Jiang, Chunyang, et autres
Publié: (2024)
Documents similaires
-
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
par: Zong, Yi, et autres
Publié: (2024) -
GAOKAO-Eval: Does high scores truly reflect strong capabilities in LLMs?
par: Lei, Zhikai, et autres
Publié: (2024) -
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026) -
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
par: Wang, Siyin, et autres
Publié: (2024) -
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
par: Chen, Kedi, et autres
Publié: (2024)