SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Feng, Kehua, Shen, Xinyi, Wang, Weijie, Zhuang, Xiang, Tang, Yuqi, Zhang, Qiang, Ding, Keyan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
von: Yu, Jing, et al.
Veröffentlicht: (2025)
von: Yu, Jing, et al.
Veröffentlicht: (2025)
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
von: Sun, Liangtai, et al.
Veröffentlicht: (2023)
von: Sun, Liangtai, et al.
Veröffentlicht: (2023)
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
von: Feng, Kehua, et al.
Veröffentlicht: (2025)
von: Feng, Kehua, et al.
Veröffentlicht: (2025)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
von: Ding, Keyan, et al.
Veröffentlicht: (2025)
von: Ding, Keyan, et al.
Veröffentlicht: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
von: Li, Tianhao, et al.
Veröffentlicht: (2024)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
von: Qiao, Shuofei, et al.
Veröffentlicht: (2026)
von: Qiao, Shuofei, et al.
Veröffentlicht: (2026)
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
von: Zhuang, Xiang, et al.
Veröffentlicht: (2025)
von: Zhuang, Xiang, et al.
Veröffentlicht: (2025)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
von: Luo, Shunyang, et al.
Veröffentlicht: (2026)
von: Luo, Shunyang, et al.
Veröffentlicht: (2026)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
von: Feng, Kehua, et al.
Veröffentlicht: (2024)
von: Feng, Kehua, et al.
Veröffentlicht: (2024)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
von: Rao, Mingyang, et al.
Veröffentlicht: (2026)
von: Rao, Mingyang, et al.
Veröffentlicht: (2026)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
von: Wang, Yiheng, et al.
Veröffentlicht: (2025)
von: Wang, Yiheng, et al.
Veröffentlicht: (2025)
SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
von: Gu, Yiyang, et al.
Veröffentlicht: (2026)
von: Gu, Yiyang, et al.
Veröffentlicht: (2026)
SciGPT: A Large Language Model for Scientific Literature Understanding and Knowledge Discovery
von: She, Fengyu, et al.
Veröffentlicht: (2025)
von: She, Fengyu, et al.
Veröffentlicht: (2025)
Scientific Large Language Models: A Survey on Biological & Chemical Domains
von: Zhang, Qiang, et al.
Veröffentlicht: (2024)
von: Zhang, Qiang, et al.
Veröffentlicht: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
von: Ma, Guoqing, et al.
Veröffentlicht: (2025)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
von: Qiao, Shuofei, et al.
Veröffentlicht: (2026)
von: Qiao, Shuofei, et al.
Veröffentlicht: (2026)
SciClaimEval: Cross-modal Claim Verification in Scientific Papers
von: Ho, Xanh, et al.
Veröffentlicht: (2026)
von: Ho, Xanh, et al.
Veröffentlicht: (2026)
Advancing biomolecular understanding and design following human instructions
von: Zhuang, Xiang, et al.
Veröffentlicht: (2024)
von: Zhuang, Xiang, et al.
Veröffentlicht: (2024)
SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
von: Feng, Kehua, et al.
Veröffentlicht: (2025)
von: Feng, Kehua, et al.
Veröffentlicht: (2025)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
von: Liu, Chuang, et al.
Veröffentlicht: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
von: Guo, Xin, et al.
Veröffentlicht: (2023)
von: Guo, Xin, et al.
Veröffentlicht: (2023)
MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models
von: Park, Dojun, et al.
Veröffentlicht: (2024)
von: Park, Dojun, et al.
Veröffentlicht: (2024)
FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning
von: Dou, Shaoyu, et al.
Veröffentlicht: (2025)
von: Dou, Shaoyu, et al.
Veröffentlicht: (2025)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
von: Wang, Chengye, et al.
Veröffentlicht: (2025)
von: Wang, Chengye, et al.
Veröffentlicht: (2025)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
von: Shen, Tianhao, et al.
Veröffentlicht: (2023)
ArxEval: Evaluating Retrieval and Generation in Language Models for Scientific Literature
von: Sinha, Aarush, et al.
Veröffentlicht: (2025)
von: Sinha, Aarush, et al.
Veröffentlicht: (2025)
SocialEval: Evaluating Social Intelligence of Large Language Models
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Jinfeng, et al.
Veröffentlicht: (2025)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
von: Wang, Xiaoxuan, et al.
Veröffentlicht: (2023)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
L-CiteEval: Do Long-Context Models Truly Leverage Context for Responding?
von: Tang, Zecheng, et al.
Veröffentlicht: (2024)
von: Tang, Zecheng, et al.
Veröffentlicht: (2024)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
von: Chen, Zehui, et al.
Veröffentlicht: (2023)
von: Chen, Zehui, et al.
Veröffentlicht: (2023)
CriticEval: Evaluating Large Language Model as Critic
von: Lan, Tian, et al.
Veröffentlicht: (2024)
von: Lan, Tian, et al.
Veröffentlicht: (2024)
A Bionic Natural Language Parser Equivalent to a Pushdown Automaton
von: Wei, Zhenghao, et al.
Veröffentlicht: (2024)
von: Wei, Zhenghao, et al.
Veröffentlicht: (2024)
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
von: He, Yuanqin, et al.
Veröffentlicht: (2024)
von: He, Yuanqin, et al.
Veröffentlicht: (2024)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
von: Liu, Yuxuan, et al.
Veröffentlicht: (2024)
von: Liu, Yuxuan, et al.
Veröffentlicht: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
von: Mukherjee, Arka, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
von: Yu, Jing, et al.
Veröffentlicht: (2025) -
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
von: Tang, Yuqi, et al.
Veröffentlicht: (2025) -
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
von: Sun, Liangtai, et al.
Veröffentlicht: (2023) -
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
von: Feng, Kehua, et al.
Veröffentlicht: (2025) -
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
von: Tang, Yuqi, et al.
Veröffentlicht: (2025)