RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Hanzheng, Fang, Xi, Li, Yixuan, Huang, Chaozheng, Wang, Junjie, Wang, Xi, Bai, Hongzhe, Hao, Bojun, Lin, Shenyu, Liang, Huiqi, Zhang, Linfeng, Ke, Guolin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
by: Tao, Haoyi, et al.
Published: (2026)
by: Tao, Haoyi, et al.
Published: (2026)
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
by: Shen, Jialu, et al.
Published: (2026)
by: Shen, Jialu, et al.
Published: (2026)
SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding
by: Li, Sihang, et al.
Published: (2024)
by: Li, Sihang, et al.
Published: (2024)
RxnNano:Training Compact LLMs for Chemical Reaction and Retrosynthesis Prediction via Hierarchical Curriculum Learning
by: Li, Ran, et al.
Published: (2026)
by: Li, Ran, et al.
Published: (2026)
Uni-Parser Technical Report
by: Fang, Xi, et al.
Published: (2025)
by: Fang, Xi, et al.
Published: (2025)
SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis
by: Cai, Hengxing, et al.
Published: (2024)
by: Cai, Hengxing, et al.
Published: (2024)
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning
by: Song, Jiahe, et al.
Published: (2025)
by: Song, Jiahe, et al.
Published: (2025)
SynBridge: Bridging Reaction States via Discrete Flow for Bidirectional Reaction Prediction
by: Lin, Haitao, et al.
Published: (2025)
by: Lin, Haitao, et al.
Published: (2025)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
by: Xiong, Lei, et al.
Published: (2026)
by: Xiong, Lei, et al.
Published: (2026)
Uni-Mol3: A Multi-Molecular Foundation Model for Advancing Organic Reaction Modeling
by: Wu, Lirong, et al.
Published: (2025)
by: Wu, Lirong, et al.
Published: (2025)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
by: Ren, Yiming, et al.
Published: (2026)
by: Ren, Yiming, et al.
Published: (2026)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
by: Xu, Qiang, et al.
Published: (2026)
by: Xu, Qiang, et al.
Published: (2026)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
by: Nie, Yiqi, et al.
Published: (2026)
by: Nie, Yiqi, et al.
Published: (2026)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
by: Wen, Zichen, et al.
Published: (2026)
by: Wen, Zichen, et al.
Published: (2026)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
by: Chen, Xin-Sheng, et al.
Published: (2026)
by: Chen, Xin-Sheng, et al.
Published: (2026)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
by: Liu, Ziqiang, et al.
Published: (2024)
by: Liu, Ziqiang, et al.
Published: (2024)
From Human Labels to Literature: Semi-Supervised Learning of NMR Chemical Shifts at Scale
by: Jin, Yongqi, et al.
Published: (2026)
by: Jin, Yongqi, et al.
Published: (2026)
MMSciBench: Benchmarking Language Models on Chinese Multimodal Scientific Problems
by: Ye, Xinwu, et al.
Published: (2025)
by: Ye, Xinwu, et al.
Published: (2025)
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
Can MLLMs "Read" What is Missing?
by: Guo, Jindi, et al.
Published: (2026)
by: Guo, Jindi, et al.
Published: (2026)
BihoT: A Large-Scale Dataset and Benchmark for Hyperspectral Camouflaged Object Tracking
by: Wang, Hanzheng, et al.
Published: (2024)
by: Wang, Hanzheng, et al.
Published: (2024)
AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond
by: Gu, Shangding, et al.
Published: (2025)
by: Gu, Shangding, et al.
Published: (2025)
Multiphysics Bench: Benchmarking and Investigating Scientific Machine Learning for Multiphysics PDEs
by: Yang, Changfan, et al.
Published: (2025)
by: Yang, Changfan, et al.
Published: (2025)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
BBOPlace-Bench: Benchmarking Black-Box Optimization for Chip Placement
by: Xue, Ke, et al.
Published: (2025)
by: Xue, Ke, et al.
Published: (2025)
TokenPowerBench: Benchmarking the Power Consumption of LLM Inference
by: Niu, Chenxu, et al.
Published: (2025)
by: Niu, Chenxu, et al.
Published: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding
by: Xie, Jiancong, et al.
Published: (2025)
by: Xie, Jiancong, et al.
Published: (2025)
Leaf area predicts conspecific spatial aggregation of woody species
by: Jingjing Xi, et al.
Published: (2024)
by: Jingjing Xi, et al.
Published: (2024)
OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems
by: Liu, Yong, et al.
Published: (2026)
by: Liu, Yong, et al.
Published: (2026)
CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography
by: Zhu, Qingqing, et al.
Published: (2026)
by: Zhu, Qingqing, et al.
Published: (2026)
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
by: Liu, Xiyan, et al.
Published: (2025)
by: Liu, Xiyan, et al.
Published: (2025)
MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild
by: Fang, Xi, et al.
Published: (2024)
by: Fang, Xi, et al.
Published: (2024)
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
by: Jiang, Mohan, et al.
Published: (2025)
by: Jiang, Mohan, et al.
Published: (2025)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
InstructionBench: An Instructional Video Understanding Benchmark
by: Wei, Haiwan, et al.
Published: (2025)
by: Wei, Haiwan, et al.
Published: (2025)
Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables
by: Zhou, Yitong, et al.
Published: (2025)
by: Zhou, Yitong, et al.
Published: (2025)
MMDG-Bench: A Benchmark for Multimodal Domain Generalization
by: Zhan, Qianshan, et al.
Published: (2026)
by: Zhan, Qianshan, et al.
Published: (2026)
VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding
by: Liu, Zibo, et al.
Published: (2026)
by: Liu, Zibo, et al.
Published: (2026)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
by: Hu, Lanxiang, et al.
Published: (2025)
by: Hu, Lanxiang, et al.
Published: (2025)
Similar Items
-
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
by: Tao, Haoyi, et al.
Published: (2026) -
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
by: Shen, Jialu, et al.
Published: (2026) -
SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding
by: Li, Sihang, et al.
Published: (2024) -
RxnNano:Training Compact LLMs for Chemical Reaction and Retrosynthesis Prediction via Hierarchical Curriculum Learning
by: Li, Ran, et al.
Published: (2026) -
Uni-Parser Technical Report
by: Fang, Xi, et al.
Published: (2025)