OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Wanhao, Xie, Jiaqing, Tan, Qian, Wang, Weida, Wang, Jue, Sun, Ran, Yang, Zhuo, Ouyang, Wanli, Bai, Lei, Fu, Tianfan, Chen, Lu, Chen, Xin, Li, Yuqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PolyReal: A Benchmark for Real-World Polymer Science Workflows
por: Liu, Wanhao, et al.
Publicado: (2026)
por: Liu, Wanhao, et al.
Publicado: (2026)
ChemMLLM: Chemical Multimodal Large Language Model
por: Tan, Qian, et al.
Publicado: (2025)
por: Tan, Qian, et al.
Publicado: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
por: Zhang, Junkai, et al.
Publicado: (2025)
por: Zhang, Junkai, et al.
Publicado: (2025)
Chem-R: Learning to Reason as a Chemist
por: Wang, Weida, et al.
Publicado: (2025)
por: Wang, Weida, et al.
Publicado: (2025)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
por: Yang, Zhuo, et al.
Publicado: (2025)
por: Yang, Zhuo, et al.
Publicado: (2025)
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
por: Xie, Jiaqing, et al.
Publicado: (2025)
por: Xie, Jiaqing, et al.
Publicado: (2025)
SkillsInjector: Dynamic Skill Context Construction for LLM Agents
por: Li, Yanchao, et al.
Publicado: (2026)
por: Li, Yanchao, et al.
Publicado: (2026)
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
por: Yang, Zhuo, et al.
Publicado: (2025)
por: Yang, Zhuo, et al.
Publicado: (2025)
DeepProtein: Deep Learning Library and Benchmark for Protein Sequence Learning
por: Xie, Jiaqing, et al.
Publicado: (2024)
por: Xie, Jiaqing, et al.
Publicado: (2024)
MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback
por: Liu, Wanhao, et al.
Publicado: (2025)
por: Liu, Wanhao, et al.
Publicado: (2025)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
por: Wang, Xuwu, et al.
Publicado: (2024)
por: Wang, Xuwu, et al.
Publicado: (2024)
MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation
por: Wu, Linhan, et al.
Publicado: (2026)
por: Wu, Linhan, et al.
Publicado: (2026)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
por: Xue, Xiangyuan, et al.
Publicado: (2024)
por: Xue, Xiangyuan, et al.
Publicado: (2024)
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
por: Wang, Lintao, et al.
Publicado: (2025)
por: Wang, Lintao, et al.
Publicado: (2025)
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
por: Peng, Zhihao, et al.
Publicado: (2025)
por: Peng, Zhihao, et al.
Publicado: (2025)
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
por: Wang, ZiDong, et al.
Publicado: (2024)
por: Wang, ZiDong, et al.
Publicado: (2024)
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
por: Wu, Mengsong, et al.
Publicado: (2025)
por: Wu, Mengsong, et al.
Publicado: (2025)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
por: Lu, Taiting, et al.
Publicado: (2026)
por: Lu, Taiting, et al.
Publicado: (2026)
RF-MatID: Dataset and Benchmark for Radio Frequency Material Identification
por: Chen, Xinyan, et al.
Publicado: (2026)
por: Chen, Xinyan, et al.
Publicado: (2026)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
por: Wang, Zeyu, et al.
Publicado: (2026)
por: Wang, Zeyu, et al.
Publicado: (2026)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
por: Yang, Zonglin, et al.
Publicado: (2024)
por: Yang, Zonglin, et al.
Publicado: (2024)
MatWheel: Addressing Data Scarcity in Materials Science Through Synthetic Data
por: Li, Wentao, et al.
Publicado: (2025)
por: Li, Wentao, et al.
Publicado: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
por: Liu, Yujie, et al.
Publicado: (2025)
por: Liu, Yujie, et al.
Publicado: (2025)
UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark
por: Liu, Kai, et al.
Publicado: (2025)
por: Liu, Kai, et al.
Publicado: (2025)
LLM4Mat-Bench: Benchmarking Large Language Models for Materials Property Prediction
por: Rubungo, Andre Niyongabo, et al.
Publicado: (2024)
por: Rubungo, Andre Niyongabo, et al.
Publicado: (2024)
MatTools: Benchmarking Large Language Models for Materials Science Tools
por: Liu, Siyu, et al.
Publicado: (2025)
por: Liu, Siyu, et al.
Publicado: (2025)
Automatic Detection of Research Values from Scientific Abstracts Across Computer Science Subfields
por: Jiang, Hang, et al.
Publicado: (2025)
por: Jiang, Hang, et al.
Publicado: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
por: Deng, Andong, et al.
Publicado: (2025)
por: Deng, Andong, et al.
Publicado: (2025)
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
por: Wang, Ben, et al.
Publicado: (2026)
por: Wang, Ben, et al.
Publicado: (2026)
SeedBench: A Multi-task Benchmark for Evaluating Large Language Models in Seed Science
por: Ying, Jie, et al.
Publicado: (2025)
por: Ying, Jie, et al.
Publicado: (2025)
SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning
por: Shen, Shuaike, et al.
Publicado: (2025)
por: Shen, Shuaike, et al.
Publicado: (2025)
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
por: Zhao, Junjie, et al.
Publicado: (2026)
por: Zhao, Junjie, et al.
Publicado: (2026)
AdaBrain-Bench: Benchmarking Brain Foundation Models for Brain-Computer Interface Applications
por: Wu, Jiamin, et al.
Publicado: (2025)
por: Wu, Jiamin, et al.
Publicado: (2025)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
por: Zhang, Di, et al.
Publicado: (2024)
por: Zhang, Di, et al.
Publicado: (2024)
SuperMat: Physically Consistent PBR Material Estimation at Interactive Rates
por: Hong, Yijia, et al.
Publicado: (2024)
por: Hong, Yijia, et al.
Publicado: (2024)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
por: Ouyang, Linke, et al.
Publicado: (2024)
por: Ouyang, Linke, et al.
Publicado: (2024)
Seeing Beyond Words: MatVQA for Challenging Visual-Scientific Reasoning in Materials Science
por: Wu, Sifan, et al.
Publicado: (2025)
por: Wu, Sifan, et al.
Publicado: (2025)
AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use
por: Yang, Yaotian, et al.
Publicado: (2025)
por: Yang, Yaotian, et al.
Publicado: (2025)
Ejemplares similares
-
PolyReal: A Benchmark for Real-World Polymer Science Workflows
por: Liu, Wanhao, et al.
Publicado: (2026) -
ChemMLLM: Chemical Multimodal Large Language Model
por: Tan, Qian, et al.
Publicado: (2025) -
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
por: Zhang, Junkai, et al.
Publicado: (2025) -
Chem-R: Learning to Reason as a Chemist
por: Wang, Weida, et al.
Publicado: (2025) -
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
por: Yang, Zhuo, et al.
Publicado: (2025)