AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Yuting, Xu, Yuanxing, Wei, Xinru, Yang, Simin, Zhu, Yangfu, Li, Yuqing, Liu, Di, Wu, Bin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024)
by: Hou, Jinchang, et al.
Published: (2024)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
by: Ning, Kangyun, et al.
Published: (2024)
by: Ning, Kangyun, et al.
Published: (2024)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
by: Li, Zhu, et al.
Published: (2025)
by: Li, Zhu, et al.
Published: (2025)
Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
by: Zhao, Shangqing, et al.
Published: (2025)
by: Zhao, Shangqing, et al.
Published: (2025)
Evaluating Chinese Ambiguity Understanding in Large Language Models
by: Mo, Junwen, et al.
Published: (2026)
by: Mo, Junwen, et al.
Published: (2026)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
by: Qiu, Haoyi, et al.
Published: (2024)
by: Qiu, Haoyi, et al.
Published: (2024)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
by: Feng, Xiaoning, et al.
Published: (2022)
by: Feng, Xiaoning, et al.
Published: (2022)
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
by: Wang, Dong
Published: (2025)
by: Wang, Dong
Published: (2025)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
by: Zhu, Jie, et al.
Published: (2024)
by: Zhu, Jie, et al.
Published: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
by: Zhang, Hengxiang, et al.
Published: (2024)
by: Zhang, Hengxiang, et al.
Published: (2024)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
by: Yu, Haiyang, et al.
Published: (2025)
by: Yu, Haiyang, et al.
Published: (2025)
Metacognitive Prompting Improves Understanding in Large Language Models
by: Wang, Yuqing, et al.
Published: (2023)
by: Wang, Yuqing, et al.
Published: (2023)
Evaluating the Generation Capabilities of Large Chinese Language Models
by: Zeng, Hui, et al.
Published: (2023)
by: Zeng, Hui, et al.
Published: (2023)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
by: Lyu, Yuanjie, et al.
Published: (2024)
by: Lyu, Yuanjie, et al.
Published: (2024)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
by: Li, Yuang, et al.
Published: (2024)
by: Li, Yuang, et al.
Published: (2024)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2025)
by: Jin, Haoan, et al.
Published: (2025)
IQA-EVAL: Automatic Evaluation of Human-Model Interactive Question Answering
by: Li, Ruosen, et al.
Published: (2024)
by: Li, Ruosen, et al.
Published: (2024)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
by: Guo, Chenlu, et al.
Published: (2024)
by: Guo, Chenlu, et al.
Published: (2024)
CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity
by: Wei, Xuefeng, et al.
Published: (2026)
by: Wei, Xuefeng, et al.
Published: (2026)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
by: Wei, Victor Junqiu, et al.
Published: (2024)
by: Wei, Victor Junqiu, et al.
Published: (2024)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
by: He, Yancheng, et al.
Published: (2024)
by: He, Yancheng, et al.
Published: (2024)
Understanding Literary Texts by LLMs: A Case Study of Ancient Chinese Poetry
by: Zhao, Cheng, et al.
Published: (2024)
by: Zhao, Cheng, et al.
Published: (2024)
Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
by: Song, Rui, et al.
Published: (2026)
by: Song, Rui, et al.
Published: (2026)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Uncertainty Awareness of Large Language Models Under Code Distribution Shifts: A Benchmark Study
by: Li, Yufei, et al.
Published: (2024)
by: Li, Yufei, et al.
Published: (2024)
CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novels
by: Wei, Lingxiao, et al.
Published: (2024)
by: Wei, Lingxiao, et al.
Published: (2024)
UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models
by: Wu, Jiajun, et al.
Published: (2025)
by: Wu, Jiajun, et al.
Published: (2025)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
by: Chen, Yanfang, et al.
Published: (2024)
by: Chen, Yanfang, et al.
Published: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
by: Guo, Xin, et al.
Published: (2023)
by: Guo, Xin, et al.
Published: (2023)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
by: Yue, Wenjing, et al.
Published: (2024)
by: Yue, Wenjing, et al.
Published: (2024)
The Impact of Visual Information in Chinese Characters: Evaluating Large Models' Ability to Recognize and Utilize Radicals
by: Wu, Xiaofeng, et al.
Published: (2024)
by: Wu, Xiaofeng, et al.
Published: (2024)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models
by: Wang, Yuqing, et al.
Published: (2024)
by: Wang, Yuqing, et al.
Published: (2024)
Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges
by: Ma, Bolei, et al.
Published: (2025)
by: Ma, Bolei, et al.
Published: (2025)
TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models
by: Cao, Jiahuan, et al.
Published: (2024)
by: Cao, Jiahuan, et al.
Published: (2024)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
Evaluating Large Language Models for Radiology Natural Language Processing
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Similar Items
-
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023) -
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024) -
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
by: Ning, Kangyun, et al.
Published: (2024) -
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
by: Li, Zhu, et al.
Published: (2025) -
Fùxì: A Benchmark for Evaluating Language Models on Ancient Chinese Text Understanding and Generation
by: Zhao, Shangqing, et al.
Published: (2025)