CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Zexuan, Li, Jingjing, Huang, Shijue, Jiao, Xiaoqi, Zhong, Wanjun, King, Irwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
di: Cui, Wenqian, et al.
Pubblicazione: (2025)
Entropy-Based Decoding for Retrieval-Augmented Large Language Models
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
di: Qiu, Zexuan, et al.
Pubblicazione: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024)
di: Li, Haitao, et al.
Pubblicazione: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024)
di: Yu, Linhao, et al.
Pubblicazione: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023)
di: Guo, Xin, et al.
Pubblicazione: (2023)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
SocialEval: Evaluating Social Intelligence of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst
di: Wang, Hongru, et al.
Pubblicazione: (2025)
di: Wang, Hongru, et al.
Pubblicazione: (2025)
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2025)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
di: Shi, Ling, et al.
Pubblicazione: (2024)
di: Shi, Ling, et al.
Pubblicazione: (2024)
CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
di: Yan, Lian, et al.
Pubblicazione: (2025)
di: Yan, Lian, et al.
Pubblicazione: (2025)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
di: Shen, Tianhao, et al.
Pubblicazione: (2023)
di: Shen, Tianhao, et al.
Pubblicazione: (2023)
MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics
di: Jin, Haoan, et al.
Pubblicazione: (2025)
di: Jin, Haoan, et al.
Pubblicazione: (2025)
ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning
di: Hu, Minda, et al.
Pubblicazione: (2026)
di: Hu, Minda, et al.
Pubblicazione: (2026)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
di: Hosseini, Mohammad, et al.
Pubblicazione: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2024)
Thus Spake Long-Context Large Language Model
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
Training-Free Long-Context Scaling of Large Language Models
di: An, Chenxin, et al.
Pubblicazione: (2024)
di: An, Chenxin, et al.
Pubblicazione: (2024)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
di: Jubair, Sheikh, et al.
Pubblicazione: (2025)
Generating Diverse Training Samples for Relation Extraction with Large Language Models
di: Li, Zexuan, et al.
Pubblicazione: (2025)
di: Li, Zexuan, et al.
Pubblicazione: (2025)
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
di: Cheng, Zihao, et al.
Pubblicazione: (2025)
di: Cheng, Zihao, et al.
Pubblicazione: (2025)
Acquiring Common Chinese Emotional Events Using Large Language Model
di: Wang, Ya, et al.
Pubblicazione: (2025)
di: Wang, Ya, et al.
Pubblicazione: (2025)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
di: Zhou, Keyan, et al.
Pubblicazione: (2025)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
di: Lu, Yuchen, et al.
Pubblicazione: (2025)
AcademicEval: Live Long-Context LLM Benchmark
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
di: Zhang, Haozhen, et al.
Pubblicazione: (2025)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
di: Lu, Yida, et al.
Pubblicazione: (2025)
di: Lu, Yida, et al.
Pubblicazione: (2025)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
di: Sun, Liangtai, et al.
Pubblicazione: (2023)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
Recent Advances in Speech Language Models: A Survey
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
di: Cui, Wenqian, et al.
Pubblicazione: (2024)
AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
di: Huang, Shijue, et al.
Pubblicazione: (2025)
di: Huang, Shijue, et al.
Pubblicazione: (2025)
Acting Less is Reasoning More! Teaching Model to Act Efficiently
di: Wang, Hongru, et al.
Pubblicazione: (2025)
di: Wang, Hongru, et al.
Pubblicazione: (2025)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
di: Tu, Quan, et al.
Pubblicazione: (2024)
di: Tu, Quan, et al.
Pubblicazione: (2024)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
di: Ouyang, Zetian, et al.
Pubblicazione: (2024)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
di: Liu, Chuang, et al.
Pubblicazione: (2024)
di: Liu, Chuang, et al.
Pubblicazione: (2024)
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
di: Li, Zexuan, et al.
Pubblicazione: (2025)
di: Li, Zexuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
di: Cui, Wenqian, et al.
Pubblicazione: (2025) -
Entropy-Based Decoding for Retrieval-Augmented Large Language Models
di: Qiu, Zexuan, et al.
Pubblicazione: (2024) -
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
di: Li, Haitao, et al.
Pubblicazione: (2024) -
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024) -
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023)