SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xiaoxuan, Hu, Ziniu, Lu, Pan, Zhu, Yanqiao, Zhang, Jieyu, Subramaniam, Satyen, Loomba, Arjun R., Zhang, Shichang, Sun, Yizhou, Wang, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
MaterialBENCH: Evaluating College-Level Materials Science Problem-Solving Abilities of Large Language Models
par: Yoshitake, Michiko, et autres
Publié: (2024)
par: Yoshitake, Michiko, et autres
Publié: (2024)
Automated Molecular Concept Generation and Labeling with Large Language Models
par: Zhang, Zimin, et autres
Publié: (2024)
par: Zhang, Zimin, et autres
Publié: (2024)
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025)
par: Zhang, Dan, et autres
Publié: (2025)
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing
par: Zhang, Tong, et autres
Publié: (2026)
par: Zhang, Tong, et autres
Publié: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence
par: Su, Encheng, et autres
Publié: (2026)
par: Su, Encheng, et autres
Publié: (2026)
SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research
par: Sun, Liangtai, et autres
Publié: (2023)
par: Sun, Liangtai, et autres
Publié: (2023)
SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
par: Zhang, Dan, et autres
Publié: (2024)
par: Zhang, Dan, et autres
Publié: (2024)
SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents
par: Ai, Kuangshi, et autres
Publié: (2026)
par: Ai, Kuangshi, et autres
Publié: (2026)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
par: Zhou, Xiyuan, et autres
Publié: (2025)
par: Zhou, Xiyuan, et autres
Publié: (2025)
A Survey on Graph Neural Network Acceleration: Algorithms, Systems, and Customized Hardware
par: Zhang, Shichang, et autres
Publié: (2023)
par: Zhang, Shichang, et autres
Publié: (2023)
FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks
par: Wang, Miles, et autres
Publié: (2026)
par: Wang, Miles, et autres
Publié: (2026)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
par: Zhang, Yaping, et autres
Publié: (2025)
par: Zhang, Yaping, et autres
Publié: (2025)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
par: Feng, Kehua, et autres
Publié: (2024)
par: Feng, Kehua, et autres
Publié: (2024)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
par: Costarelli, Anthony, et autres
Publié: (2024)
par: Costarelli, Anthony, et autres
Publié: (2024)
SciDMT: A Large-Scale Corpus for Detecting Scientific Mentions
par: Pan, Huitong, et autres
Publié: (2024)
par: Pan, Huitong, et autres
Publié: (2024)
MIRAI: Evaluating LLM Agents for Event Forecasting
par: Ye, Chenchen, et autres
Publié: (2024)
par: Ye, Chenchen, et autres
Publié: (2024)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
par: Wang, Yiheng, et autres
Publié: (2025)
par: Wang, Yiheng, et autres
Publié: (2025)
Deconfounded Causality-aware Parameter-Efficient Fine-Tuning for Problem-Solving Improvement of LLMs
par: Wang, Ruoyu, et autres
Publié: (2024)
par: Wang, Ruoyu, et autres
Publié: (2024)
Enhancing the Geometric Problem-Solving Ability of Multimodal LLMs via Symbolic-Neural Integration
par: Pan, Yicheng, et autres
Publié: (2025)
par: Pan, Yicheng, et autres
Publié: (2025)
Effects of Digital Game‐Based Learning on Student's Problem‐Solving Ability: A Three‐Level Meta‐Analysis
par: Zhihui Cai, et autres
Publié: (2025)
par: Zhihui Cai, et autres
Publié: (2025)
SciPaths: Forecasting Pathways to Scientific Discovery
par: Chamoun, Eric, et autres
Publié: (2026)
par: Chamoun, Eric, et autres
Publié: (2026)
AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
par: Li, Chenyue, et autres
Publié: (2025)
par: Li, Chenyue, et autres
Publié: (2025)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
par: Chen, Haotian, et autres
Publié: (2025)
par: Chen, Haotian, et autres
Publié: (2025)
SciTopic: Enhancing Topic Discovery in Scientific Literature through Advanced LLM
par: Li, Pengjiang, et autres
Publié: (2025)
par: Li, Pengjiang, et autres
Publié: (2025)
Faster Rates For Federated Variational Inequalities
par: Wang, Guanghui, et autres
Publié: (2026)
par: Wang, Guanghui, et autres
Publié: (2026)
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
par: Yu, Jing, et autres
Publié: (2025)
par: Yu, Jing, et autres
Publié: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
par: Qin, Yiwei, et autres
Publié: (2024)
par: Qin, Yiwei, et autres
Publié: (2024)
An Evaluation of Large Language Models in Bioinformatics Research
par: Yin, Hengchuang, et autres
Publié: (2024)
par: Yin, Hengchuang, et autres
Publié: (2024)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
par: Qiao, Shuofei, et autres
Publié: (2026)
par: Qiao, Shuofei, et autres
Publié: (2026)
GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
The Public Library and Adult Education in India
par: Maitra, Satyen
Publié: (1974)
par: Maitra, Satyen
Publié: (1974)
INTAMEL Meeting 1973, India. The Public Library and Adult Education in India
par: Maitra, Satyen
Publié: (1974)
par: Maitra, Satyen
Publié: (1974)
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
par: Gu, Yiyang, et autres
Publié: (2026)
par: Gu, Yiyang, et autres
Publié: (2026)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
par: Ma, Mingyu Derek, et autres
Publié: (2024)
par: Ma, Mingyu Derek, et autres
Publié: (2024)
Conceptual Level Development in Higher Ability College Students.
par: Skipper, Charles E.
Publié: (1990)
par: Skipper, Charles E.
Publié: (1990)
Documents similaires
-
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025) -
MaterialBENCH: Evaluating College-Level Materials Science Problem-Solving Abilities of Large Language Models
par: Yoshitake, Michiko, et autres
Publié: (2024) -
Automated Molecular Concept Generation and Labeling with Large Language Models
par: Zhang, Zimin, et autres
Publié: (2024) -
DataSciBench: An LLM Agent Benchmark for Data Science
par: Zhang, Dan, et autres
Publié: (2025) -
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing
par: Zhang, Tong, et autres
Publié: (2026)