MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Junkai, Gan, Jingru, Wang, Xiaoxuan, Jia, Zian, Gu, Changquan, Chen, Jianpeng, Zhu, Yanqiao, Ma, Mingyu Derek, Zhou, Dawei, Li, Ling, Wang, Wei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
by: Chen, Jianpeng, et al.
Published: (2025)
by: Chen, Jianpeng, et al.
Published: (2025)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023)
by: Wang, Xiaoxuan, et al.
Published: (2023)
METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
by: Chen, Jianpeng, et al.
Published: (2026)
by: Chen, Jianpeng, et al.
Published: (2026)
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
by: Liu, Wanhao, et al.
Published: (2026)
by: Liu, Wanhao, et al.
Published: (2026)
MatLLMSearch: Crystal Structure Discovery with Evolution-Guided Large Language Models
by: Gan, Jingru, et al.
Published: (2025)
by: Gan, Jingru, et al.
Published: (2025)
MetaScientist: A Human-AI Synergistic Framework for Automated Mechanical Metamaterial Design
by: Qi, Jingyuan, et al.
Published: (2024)
by: Qi, Jingyuan, et al.
Published: (2024)
Benchmarking Cross-Scale Perception Ability of Large Multimodal Models in Material Science
by: Zheng, Yuting, et al.
Published: (2026)
by: Zheng, Yuting, et al.
Published: (2026)
MatTools: Benchmarking Large Language Models for Materials Science Tools
by: Liu, Siyu, et al.
Published: (2025)
by: Liu, Siyu, et al.
Published: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction
by: Rubungo, Andre Niyongabo, et al.
Published: (2024)
by: Rubungo, Andre Niyongabo, et al.
Published: (2024)
VideoMat: Extracting PBR Materials from Video Diffusion Models
by: Munkberg, Jacob, et al.
Published: (2025)
by: Munkberg, Jacob, et al.
Published: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
by: Ma, Mingyu Derek, et al.
Published: (2024)
by: Ma, Mingyu Derek, et al.
Published: (2024)
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
by: Wu, Linhan, et al.
Published: (2026)
by: Wu, Linhan, et al.
Published: (2026)
DataSciBench: An LLM Agent Benchmark for Data Science
by: Zhang, Dan, et al.
Published: (2025)
by: Zhang, Dan, et al.
Published: (2025)
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
by: Liu, Heyang, et al.
Published: (2025)
by: Liu, Heyang, et al.
Published: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
by: Hou, Yixuan, et al.
Published: (2025)
by: Hou, Yixuan, et al.
Published: (2025)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
by: Wang, Yuhang, et al.
Published: (2026)
by: Wang, Yuhang, et al.
Published: (2026)
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
by: Liu, Heyang, et al.
Published: (2025)
by: Liu, Heyang, et al.
Published: (2025)
Disentangling Memory and Reasoning Ability in Large Language Models
by: Jin, Mingyu, et al.
Published: (2024)
by: Jin, Mingyu, et al.
Published: (2024)
Entropy-Based Adaptive Weighting for Self-Training
by: Wang, Xiaoxuan, et al.
Published: (2025)
by: Wang, Xiaoxuan, et al.
Published: (2025)
FetchBench: A Simulation Benchmark for Robot Fetching
by: Han, Beining, et al.
Published: (2024)
by: Han, Beining, et al.
Published: (2024)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
by: Yang, Siwei, et al.
Published: (2024)
by: Yang, Siwei, et al.
Published: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
by: Gui, Jiayi, et al.
Published: (2024)
by: Gui, Jiayi, et al.
Published: (2024)
Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and Toolbox
by: Wang, Haohui, et al.
Published: (2023)
by: Wang, Haohui, et al.
Published: (2023)
MatSciRE: Leveraging Pointer Networks to Automate Entity and Relation Extraction for Material Science Knowledge-base Construction
by: Mullick, Ankan, et al.
Published: (2024)
by: Mullick, Ankan, et al.
Published: (2024)
Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science
by: Wu, Sifan, et al.
Published: (2025)
by: Wu, Sifan, et al.
Published: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials
by: Li, Zhaohui, et al.
Published: (2026)
by: Li, Zhaohui, et al.
Published: (2026)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
by: Mai, Zheda, et al.
Published: (2025)
by: Mai, Zheda, et al.
Published: (2025)
MatWheel: Addressing Data Scarcity in Materials Science Through Synthetic Data
by: Li, Wentao, et al.
Published: (2025)
by: Li, Wentao, et al.
Published: (2025)
Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services
by: Guo, Hongcheng, et al.
Published: (2025)
by: Guo, Hongcheng, et al.
Published: (2025)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
by: Fan, Lizhou, et al.
Published: (2023)
by: Fan, Lizhou, et al.
Published: (2023)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
by: Lin, Jingru, et al.
Published: (2026)
by: Lin, Jingru, et al.
Published: (2026)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
by: Hu, Tiancheng, et al.
Published: (2025)
by: Hu, Tiancheng, et al.
Published: (2025)
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
by: Ma, Mingyu Derek, et al.
Published: (2025)
by: Ma, Mingyu Derek, et al.
Published: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
by: Kang, Zhaolu, et al.
Published: (2025)
by: Kang, Zhaolu, et al.
Published: (2025)
AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
by: Li, Chenyue, et al.
Published: (2025)
by: Li, Chenyue, et al.
Published: (2025)
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
by: Ma, Mingyu Derek, et al.
Published: (2023)
by: Ma, Mingyu Derek, et al.
Published: (2023)
Adaptive-Solver Framework for Dynamic Strategy Selection in Large Language Model Reasoning
by: Zhou, Jianpeng, et al.
Published: (2023)
by: Zhou, Jianpeng, et al.
Published: (2023)
Are Large-Language Models Graph Algorithmic Reasoners?
by: Taylor, Alexander K, et al.
Published: (2024)
by: Taylor, Alexander K, et al.
Published: (2024)
Similar Items
-
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
by: Chen, Jianpeng, et al.
Published: (2025) -
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
by: Wang, Xiaoxuan, et al.
Published: (2023) -
METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
by: Chen, Jianpeng, et al.
Published: (2026) -
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
by: Liu, Wanhao, et al.
Published: (2026) -
MatLLMSearch: Crystal Structure Discovery with Evolution-Guided Large Language Models
by: Gan, Jingru, et al.
Published: (2025)