Saved in:
| Main Authors: | Liu, Wanhao, Xie, Jiaqing, Tan, Qian, Wang, Weida, Wang, Jue, Sun, Ran, Yang, Zhuo, Ouyang, Wanli, Bai, Lei, Fu, Tianfan, Chen, Lu, Chen, Xin, Li, Yuqiang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.29833 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PolyReal: A Benchmark for Real-World Polymer Science Workflows
by: Liu, Wanhao, et al.
Published: (2026)
by: Liu, Wanhao, et al.
Published: (2026)
ChemMLLM: Chemical Multimodal Large Language Model
by: Tan, Qian, et al.
Published: (2025)
by: Tan, Qian, et al.
Published: (2025)
Chem-R: Learning to Reason as a Chemist
by: Wang, Weida, et al.
Published: (2025)
by: Wang, Weida, et al.
Published: (2025)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
by: Yang, Zhuo, et al.
Published: (2025)
by: Yang, Zhuo, et al.
Published: (2025)
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
by: Xie, Jiaqing, et al.
Published: (2025)
by: Xie, Jiaqing, et al.
Published: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
by: Zhang, Junkai, et al.
Published: (2025)
by: Zhang, Junkai, et al.
Published: (2025)
SkillsInjector: Dynamic Skill Context Construction for LLM Agents
by: Li, Yanchao, et al.
Published: (2026)
by: Li, Yanchao, et al.
Published: (2026)
MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback
by: Liu, Wanhao, et al.
Published: (2025)
by: Liu, Wanhao, et al.
Published: (2025)
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
by: Yang, Zhuo, et al.
Published: (2025)
by: Yang, Zhuo, et al.
Published: (2025)
DeepProtein: Deep Learning Library and Benchmark for Protein Sequence Learning
by: Xie, Jiaqing, et al.
Published: (2024)
by: Xie, Jiaqing, et al.
Published: (2024)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
by: Wang, Jiayu, et al.
Published: (2025)
by: Wang, Jiayu, et al.
Published: (2025)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
by: Xue, Xiangyuan, et al.
Published: (2024)
by: Xue, Xiangyuan, et al.
Published: (2024)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
by: Yang, Zonglin, et al.
Published: (2024)
by: Yang, Zonglin, et al.
Published: (2024)
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
by: Wang, Lintao, et al.
Published: (2025)
by: Wang, Lintao, et al.
Published: (2025)
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
by: Wang, ZiDong, et al.
Published: (2024)
by: Wang, ZiDong, et al.
Published: (2024)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
by: Wang, Xuwu, et al.
Published: (2024)
by: Wang, Xuwu, et al.
Published: (2024)
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
by: Wu, Linhan, et al.
Published: (2026)
by: Wu, Linhan, et al.
Published: (2026)
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
by: Peng, Zhihao, et al.
Published: (2025)
by: Peng, Zhihao, et al.
Published: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
by: Liu, Yujie, et al.
Published: (2025)
by: Liu, Yujie, et al.
Published: (2025)
RF-MatID: Dataset and Benchmark for Radio Frequency Material Identification
by: Chen, Xinyan, et al.
Published: (2026)
by: Chen, Xinyan, et al.
Published: (2026)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
by: Lu, Taiting, et al.
Published: (2026)
by: Lu, Taiting, et al.
Published: (2026)
SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning
by: Shen, Shuaike, et al.
Published: (2025)
by: Shen, Shuaike, et al.
Published: (2025)
MatWheel: Addressing Data Scarcity in Materials Science Through Synthetic Data
by: Li, Wentao, et al.
Published: (2025)
by: Li, Wentao, et al.
Published: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
by: Chen, Chen, et al.
Published: (2025)
by: Chen, Chen, et al.
Published: (2025)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
by: Wang, Zeyu, et al.
Published: (2026)
by: Wang, Zeyu, et al.
Published: (2026)
UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark
by: Liu, Kai, et al.
Published: (2025)
by: Liu, Kai, et al.
Published: (2025)
LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction
by: Rubungo, Andre Niyongabo, et al.
Published: (2024)
by: Rubungo, Andre Niyongabo, et al.
Published: (2024)
MatTools: Benchmarking Large Language Models for Materials Science Tools
by: Liu, Siyu, et al.
Published: (2025)
by: Liu, Siyu, et al.
Published: (2025)
Automatic Detection of Research Values from Scientific Abstracts Across Computer Science Subfields
by: Jiang, Hang, et al.
Published: (2025)
by: Jiang, Hang, et al.
Published: (2025)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
by: Zhang, Di, et al.
Published: (2024)
by: Zhang, Di, et al.
Published: (2024)
SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science
by: Ying, Jie, et al.
Published: (2025)
by: Ying, Jie, et al.
Published: (2025)
AdaBrain-Bench: Benchmarking Brain Foundation Models for Brain-Computer Interface Applications
by: Wu, Jiamin, et al.
Published: (2025)
by: Wu, Jiamin, et al.
Published: (2025)
AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use
by: Yang, Yaotian, et al.
Published: (2025)
by: Yang, Yaotian, et al.
Published: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
by: Wang, Ben, et al.
Published: (2026)
by: Wang, Ben, et al.
Published: (2026)
Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B
by: Zhang, Di, et al.
Published: (2024)
by: Zhang, Di, et al.
Published: (2024)
Iterative Pretraining Framework for Interatomic Potentials
by: Cui, Taoyong, et al.
Published: (2025)
by: Cui, Taoyong, et al.
Published: (2025)
Revisiting the Broken Symmetry Phase of Solid Hydrogen: A Neural Network Variational Monte Carlo Study
by: Chai, Shengdu, et al.
Published: (2025)
by: Chai, Shengdu, et al.
Published: (2025)
SuperMat: Physically Consistent PBR Material Estimation at Interactive Rates
by: Hong, Yijia, et al.
Published: (2024)
by: Hong, Yijia, et al.
Published: (2024)
Similar Items
-
PolyReal: A Benchmark for Real-World Polymer Science Workflows
by: Liu, Wanhao, et al.
Published: (2026) -
ChemMLLM: Chemical Multimodal Large Language Model
by: Tan, Qian, et al.
Published: (2025) -
Chem-R: Learning to Reason as a Chemist
by: Wang, Weida, et al.
Published: (2025) -
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
by: Yang, Zhuo, et al.
Published: (2025) -
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
by: Xie, Jiaqing, et al.
Published: (2025)