MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junkai, Gan, Jingru, Wang, Xiaoxuan, Jia, Zian, Gu, Changquan, Chen, Jianpeng, Zhu, Yanqiao, Ma, Mingyu Derek, Zhou, Dawei, Li, Ling, Wang, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
di: Chen, Jianpeng, et al.
Pubblicazione: (2025)
di: Chen, Jianpeng, et al.
Pubblicazione: (2025)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
di: Chen, Jianpeng, et al.
Pubblicazione: (2026)
di: Chen, Jianpeng, et al.
Pubblicazione: (2026)
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
di: Liu, Wanhao, et al.
Pubblicazione: (2026)
di: Liu, Wanhao, et al.
Pubblicazione: (2026)
MatLLMSearch: Crystal Structure Discovery with Evolution-Guided Large Language Models
di: Gan, Jingru, et al.
Pubblicazione: (2025)
di: Gan, Jingru, et al.
Pubblicazione: (2025)
MetaScientist: A Human-AI Synergistic Framework for Automated Mechanical Metamaterial Design
di: Qi, Jingyuan, et al.
Pubblicazione: (2024)
di: Qi, Jingyuan, et al.
Pubblicazione: (2024)
Benchmarking Cross-Scale Perception Ability of Large Multimodal Models in Material Science
di: Zheng, Yuting, et al.
Pubblicazione: (2026)
di: Zheng, Yuting, et al.
Pubblicazione: (2026)
MatTools: Benchmarking Large Language Models for Materials Science Tools
di: Liu, Siyu, et al.
Pubblicazione: (2025)
di: Liu, Siyu, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction
di: Rubungo, Andre Niyongabo, et al.
Pubblicazione: (2024)
di: Rubungo, Andre Niyongabo, et al.
Pubblicazione: (2024)
VideoMat: Extracting PBR Materials from Video Diffusion Models
di: Munkberg, Jacob, et al.
Pubblicazione: (2025)
di: Munkberg, Jacob, et al.
Pubblicazione: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2024)
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
di: Wu, Linhan, et al.
Pubblicazione: (2026)
di: Wu, Linhan, et al.
Pubblicazione: (2026)
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
di: Liu, Heyang, et al.
Pubblicazione: (2025)
di: Liu, Heyang, et al.
Pubblicazione: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context
di: Liu, Heyang, et al.
Pubblicazione: (2025)
di: Liu, Heyang, et al.
Pubblicazione: (2025)
Disentangling Memory and Reasoning Ability in Large Language Models
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
Entropy-Based Adaptive Weighting for Self-Training
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2025)
FetchBench: A Simulation Benchmark for Robot Fetching
di: Han, Beining, et al.
Pubblicazione: (2024)
di: Han, Beining, et al.
Pubblicazione: (2024)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
Towards Heterogeneous Long-tailed Learning: Benchmarking, Metrics, and Toolbox
di: Wang, Haohui, et al.
Pubblicazione: (2023)
di: Wang, Haohui, et al.
Pubblicazione: (2023)
MatSciRE: Leveraging Pointer Networks to Automate Entity and Relation Extraction for Material Science Knowledge-base Construction
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science
di: Wu, Sifan, et al.
Pubblicazione: (2025)
di: Wu, Sifan, et al.
Pubblicazione: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023)
di: Chu, Zheng, et al.
Pubblicazione: (2023)
SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials
di: Li, Zhaohui, et al.
Pubblicazione: (2026)
di: Li, Zhaohui, et al.
Pubblicazione: (2026)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
di: Mai, Zheda, et al.
Pubblicazione: (2025)
di: Mai, Zheda, et al.
Pubblicazione: (2025)
MatWheel: Addressing Data Scarcity in Materials Science Through Synthetic Data
di: Li, Wentao, et al.
Pubblicazione: (2025)
di: Li, Wentao, et al.
Pubblicazione: (2025)
Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
di: Guo, Hongcheng, et al.
Pubblicazione: (2025)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2025)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
di: Kang, Zhaolu, et al.
Pubblicazione: (2025)
AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science
di: Li, Chenyue, et al.
Pubblicazione: (2025)
di: Li, Chenyue, et al.
Pubblicazione: (2025)
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2023)
di: Ma, Mingyu Derek, et al.
Pubblicazione: (2023)
Adaptive-Solver Framework for Dynamic Strategy Selection in Large Language Model Reasoning
di: Zhou, Jianpeng, et al.
Pubblicazione: (2023)
di: Zhou, Jianpeng, et al.
Pubblicazione: (2023)
Are Large-Language Models Graph Algorithmic Reasoners?
di: Taylor, Alexander K, et al.
Pubblicazione: (2024)
di: Taylor, Alexander K, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MetamatBench: Integrating Heterogeneous Data, Computational Tools, and Visual Interface for Metamaterial Discovery
di: Chen, Jianpeng, et al.
Pubblicazione: (2025) -
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023) -
METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution
di: Chen, Jianpeng, et al.
Pubblicazione: (2026) -
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
di: Liu, Wanhao, et al.
Pubblicazione: (2026) -
MatLLMSearch: Crystal Structure Discovery with Evolution-Guided Large Language Models
di: Gan, Jingru, et al.
Pubblicazione: (2025)