RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Tianhao, Li, Sun, Tu, Quan, Xiong, Deyi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024)
von: Shi, Ling, et al.
Veröffentlicht: (2024)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
von: Tu, Quan, et al.
Veröffentlicht: (2024)
von: Tu, Quan, et al.
Veröffentlicht: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
von: Sun, Liangtai, et al.
Veröffentlicht: (2023)
von: Sun, Liangtai, et al.
Veröffentlicht: (2023)
IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models
von: Bharti, Saurabh, et al.
Veröffentlicht: (2026)
von: Bharti, Saurabh, et al.
Veröffentlicht: (2026)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
von: Liu, Yan, et al.
Veröffentlicht: (2024)
von: Liu, Yan, et al.
Veröffentlicht: (2024)
Evaluating Discourse Cohesion in Pre-trained Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
ProBench: Benchmarking Large Language Models in Competitive Programming
von: Yang, Lei, et al.
Veröffentlicht: (2025)
von: Yang, Lei, et al.
Veröffentlicht: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
von: Li, Haitao, et al.
Veröffentlicht: (2024)
von: Li, Haitao, et al.
Veröffentlicht: (2024)
CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models
von: Qiu, Zexuan, et al.
Veröffentlicht: (2024)
von: Qiu, Zexuan, et al.
Veröffentlicht: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
von: Guo, Xin, et al.
Veröffentlicht: (2023)
von: Guo, Xin, et al.
Veröffentlicht: (2023)
Assessing the Role of Data Quality in Training Bilingual Language Models
von: Seto, Skyler, et al.
Veröffentlicht: (2025)
von: Seto, Skyler, et al.
Veröffentlicht: (2025)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
von: Fu, Lingyue, et al.
Veröffentlicht: (2023)
von: Fu, Lingyue, et al.
Veröffentlicht: (2023)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
von: Hosseini, Mohammad, et al.
Veröffentlicht: (2025)
von: Hosseini, Mohammad, et al.
Veröffentlicht: (2025)
LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
von: Jubair, Sheikh, et al.
Veröffentlicht: (2025)
von: Jubair, Sheikh, et al.
Veröffentlicht: (2025)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
von: Wu, Xiaojun, et al.
Veröffentlicht: (2024)
von: Wu, Xiaojun, et al.
Veröffentlicht: (2024)
Self-Pluralising Culture Alignment for Large Language Models
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
von: Xu, Shaoyang, et al.
Veröffentlicht: (2024)
IPEval: A Bilingual Intellectual Property Agency Consultation Evaluation Benchmark for Large Language Models
von: Wang, Qiyao, et al.
Veröffentlicht: (2024)
von: Wang, Qiyao, et al.
Veröffentlicht: (2024)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
von: Lee, Suhyun, et al.
Veröffentlicht: (2026)
von: Lee, Suhyun, et al.
Veröffentlicht: (2026)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
von: Lu, Yuchen, et al.
Veröffentlicht: (2025)
AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
von: Yan, Lian, et al.
Veröffentlicht: (2025)
von: Yan, Lian, et al.
Veröffentlicht: (2025)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
von: Jiang, Changhao, et al.
Veröffentlicht: (2025)
von: Jiang, Changhao, et al.
Veröffentlicht: (2025)
OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
von: Raihan, Nishat, et al.
Veröffentlicht: (2024)
von: Raihan, Nishat, et al.
Veröffentlicht: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
SocialEval: Evaluating Social Intelligence of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Do Large Language Models Mirror Cognitive Language Processing?
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
von: Ren, Yuqi, et al.
Veröffentlicht: (2024)
OnionEval: An Unified Evaluation of Fact-conflicting Hallucination for Small-Large Language Models
von: Sun, Chongren, et al.
Veröffentlicht: (2025)
von: Sun, Chongren, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
Large Language Model Safety: A Holistic Survey
von: Shi, Dan, et al.
Veröffentlicht: (2024)
von: Shi, Dan, et al.
Veröffentlicht: (2024)
Efficiently Exploring Large Language Models for Document-Level Machine Translation with In-context Learning
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
von: Cui, Menglong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
von: Shi, Ling, et al.
Veröffentlicht: (2024) -
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
von: Tu, Quan, et al.
Veröffentlicht: (2024) -
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024) -
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024) -
MoE-CT: A Novel Approach For Large Language Models Training With Resistance To Catastrophic Forgetting
von: Li, Tianhao, et al.
Veröffentlicht: (2024)