LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Chuang, Jin, Renren, Ren, Yuqi, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
von: Shi, Dan, et al.
Veröffentlicht: (2026)
von: Shi, Dan, et al.
Veröffentlicht: (2026)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
Multilingual Large Language Models: A Systematic Survey
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2024)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
DEP: A Decentralized Large Language Model Evaluation Protocol
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
von: Peng, Jianxiang, et al.
Veröffentlicht: (2026)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
von: Zhu, Shaolin, et al.
Veröffentlicht: (2025)
IRCAN: Mitigating Knowledge Conflicts in LLM Generation via Identifying and Reweighting Context-Aware Neurons
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
von: Dong, Weilong, et al.
Veröffentlicht: (2024)
From Curated Data to Scalable Models: Continual Pre-training of Dense and MoE Large Language Models for Tibetan
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
von: Guo, Xin, et al.
Veröffentlicht: (2023)
von: Guo, Xin, et al.
Veröffentlicht: (2023)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
von: Lan, Tian, et al.
Veröffentlicht: (2025)
von: Lan, Tian, et al.
Veröffentlicht: (2025)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Hengxiang, et al.
Veröffentlicht: (2024)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
Evaluating and Improving Graph to Text Generation with Large Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
von: Feng, Kehua, et al.
Veröffentlicht: (2024)
von: Feng, Kehua, et al.
Veröffentlicht: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
von: Xie, Qianqian, et al.
Veröffentlicht: (2024)
von: Xie, Qianqian, et al.
Veröffentlicht: (2024)
PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
von: Qiu, Shi, et al.
Veröffentlicht: (2025)
von: Qiu, Shi, et al.
Veröffentlicht: (2025)
Evaluating Discourse Cohesion in Pre-trained Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
von: Li, Haitao, et al.
Veröffentlicht: (2024)
von: Li, Haitao, et al.
Veröffentlicht: (2024)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
von: Zhang, Alexander, et al.
Veröffentlicht: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
von: Gu, Zhouhong, et al.
Veröffentlicht: (2023)
von: Gu, Zhouhong, et al.
Veröffentlicht: (2023)
TaP: A Taxonomy-Guided Framework for Automated and Scalable Preference Data Generation
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
C$^{3}$Bench: A Comprehensive Classical Chinese Understanding Benchmark for Large Language Models
von: Cao, Jiahuan, et al.
Veröffentlicht: (2024)
von: Cao, Jiahuan, et al.
Veröffentlicht: (2024)
INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
von: Chen, Shisong, et al.
Veröffentlicht: (2025)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
von: Zhang, Lin, et al.
Veröffentlicht: (2025)
von: Zhang, Lin, et al.
Veröffentlicht: (2025)
Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models
von: Liu, Jin, et al.
Veröffentlicht: (2024)
von: Liu, Jin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024) -
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024) -
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024) -
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025) -
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)