GAOKAO-Eval: Does high scores truly reflect strong capabilities in LLMs?
Fuente:
arXiv
Saved in:
| Main Authors: | Lei, Zhikai, Liang, Tianyi, Hu, Hanglei, Zhang, Jin, Zhou, Yunhua, Shao, Yunfan, Li, Linyang, Li, Chenchui, Wang, Changbo, Yan, Hang, Guo, Qipeng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
by: Zhang, Xiaotian, et al.
Published: (2023)
by: Zhang, Xiaotian, et al.
Published: (2023)
Unearthing Large Scale Domain-Specific Knowledge from Public Corpora
by: Fei, Zhaoye, et al.
Published: (2024)
by: Fei, Zhaoye, et al.
Published: (2024)
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
by: Ma, Yichuan, et al.
Published: (2025)
by: Ma, Yichuan, et al.
Published: (2025)
FastMCTS: A Simple Sampling Strategy for Data Synthesis
by: Li, Peiji, et al.
Published: (2025)
by: Li, Peiji, et al.
Published: (2025)
Balanced Data Sampling for Language Model Training with Clustering
by: Shao, Yunfan, et al.
Published: (2024)
by: Shao, Yunfan, et al.
Published: (2024)
Does Porphyromonas gingivalis truly inhibit the oral carcinogenesis?
by: Chen‐xi Li, et al.
Published: (2025)
by: Chen‐xi Li, et al.
Published: (2025)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
by: Zeng, Zhiyuan, et al.
Published: (2024)
by: Zeng, Zhiyuan, et al.
Published: (2024)
Does insect trapping truly measure insect populations?
by: Luca Rossini, et al.
Published: (2025)
by: Luca Rossini, et al.
Published: (2025)
Case2Code: Scalable Synthetic Data for Code Generation
by: Shao, Yunfan, et al.
Published: (2024)
by: Shao, Yunfan, et al.
Published: (2024)
Interactive visual query of density maps on latent space via flow‐based models
by: Ning Li, et al.
Published: (2024)
by: Ning Li, et al.
Published: (2024)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
by: Wang, Bo, et al.
Published: (2025)
by: Wang, Bo, et al.
Published: (2025)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
by: Li, Xiaozhe, et al.
Published: (2026)
by: Li, Xiaozhe, et al.
Published: (2026)
Breve história do ensino superior brasileiro e da formação de professores para a escola secundária
by: Núria Hanglei Cacete
Published: (2014)
by: Núria Hanglei Cacete
Published: (2014)
A EVOLUÇÃO DO ENSINO SUPERIOR BRASILEIRO E A FORMAÇÃO DE PROFESSORES DE GEOGRAFIA
by: Núria Hanglei Cacete
Published: (2011)
by: Núria Hanglei Cacete
Published: (2011)
Unified Active Retrieval for Retrieval Augmented Generation
by: Cheng, Qinyuan, et al.
Published: (2024)
by: Cheng, Qinyuan, et al.
Published: (2024)
Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning
by: Hu, Jiayun, et al.
Published: (2025)
by: Hu, Jiayun, et al.
Published: (2025)
MPJudge: Towards Perceptual Assessment of Music-Induced Paintings
by: Jiang, Shiqi, et al.
Published: (2025)
by: Jiang, Shiqi, et al.
Published: (2025)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
by: Zong, Yi, et al.
Published: (2024)
by: Zong, Yi, et al.
Published: (2024)
F-Eval: Assessing Fundamental Abilities with Refined Evaluation Methods
by: Sun, Yu, et al.
Published: (2024)
by: Sun, Yu, et al.
Published: (2024)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
by: Xie, Yuxuan, et al.
Published: (2024)
by: Xie, Yuxuan, et al.
Published: (2024)
Combined grey prediction fuzzy control law with application to road tunnel ventilation system
by: Li Yunhua
Published: (2015)
by: Li Yunhua
Published: (2015)
Data-free Weight Compress and Denoise for Large Language Models
by: Peng, Runyu, et al.
Published: (2024)
by: Peng, Runyu, et al.
Published: (2024)
Code Needs Comments: Enhancing Code LLMs with Comment Augmentation
by: Song, Demin, et al.
Published: (2024)
by: Song, Demin, et al.
Published: (2024)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
by: Peng, Runyu, et al.
Published: (2026)
by: Peng, Runyu, et al.
Published: (2026)
Analysis of instruction-based LLMs' capabilities to score and judge text-input problems in an academic setting
by: Ramirez-Garcia, Valeria, et al.
Published: (2025)
by: Ramirez-Garcia, Valeria, et al.
Published: (2025)
Does the survival and sudden death of quadripartite steering in curved spacetime truly depend on multi-directionality?
by: Liu, Xiaobao, et al.
Published: (2025)
by: Liu, Xiaobao, et al.
Published: (2025)
How to Set the Learning Rate for Large-Scale Pre-training?
by: Zhou, Yunhua, et al.
Published: (2026)
by: Zhou, Yunhua, et al.
Published: (2026)
Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities
by: Saon, George, et al.
Published: (2025)
by: Saon, George, et al.
Published: (2025)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
by: Ma, Yichuan, et al.
Published: (2026)
by: Ma, Yichuan, et al.
Published: (2026)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
by: Shu, Lei, et al.
Published: (2023)
by: Shu, Lei, et al.
Published: (2023)
Gain on ground state of quantum system for truly $\mathcal{PT}$ symmetry
by: Liu, Bing-Bing, et al.
Published: (2025)
by: Liu, Bing-Bing, et al.
Published: (2025)
AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters
by: Luo, Hanjun, et al.
Published: (2026)
by: Luo, Hanjun, et al.
Published: (2026)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
by: Cheng, Zhili, et al.
Published: (2025)
by: Cheng, Zhili, et al.
Published: (2025)
Change-Point Detection for Object-valued Time Series
by: Zhang, Yi, et al.
Published: (2026)
by: Zhang, Yi, et al.
Published: (2026)
Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
by: Ma, Yichuan, et al.
Published: (2026)
by: Ma, Yichuan, et al.
Published: (2026)
ZNO-Eval: Benchmarking reasoning capabilities of large language models in Ukrainian
by: Syromiatnikov, Mykyta, et al.
Published: (2025)
by: Syromiatnikov, Mykyta, et al.
Published: (2025)
TextCenGen: Attention-Guided Text-Centric Background Adaptation for Text-to-Image Generation
by: Liang, Tianyi, et al.
Published: (2024)
by: Liang, Tianyi, et al.
Published: (2024)
Evolutionary turnover of sRNA target interaction in Enterobacteriaceae
by: Yunfan, Jin
Published: (2026)
by: Yunfan, Jin
Published: (2026)
KG4RecEval: Does Knowledge Graph Really Matter for Recommender Systems?
by: Zhang, Haonan, et al.
Published: (2024)
by: Zhang, Haonan, et al.
Published: (2024)
Are UX evaluation methods truly accessible
by: Fuentes-Cortázar, Andrés Eduardo, et al.
Published: (2025)
by: Fuentes-Cortázar, Andrés Eduardo, et al.
Published: (2025)
Similar Items
-
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
by: Zhang, Xiaotian, et al.
Published: (2023) -
Unearthing Large Scale Domain-Specific Knowledge from Public Corpora
by: Fei, Zhaoye, et al.
Published: (2024) -
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
by: Ma, Yichuan, et al.
Published: (2025) -
FastMCTS: A Simple Sampling Strategy for Data Synthesis
by: Li, Peiji, et al.
Published: (2025) -
Balanced Data Sampling for Language Model Training with Clustering
by: Shao, Yunfan, et al.
Published: (2024)