ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yujie, Yang, Zonglin, Xie, Tong, Ni, Jinjie, Gao, Ben, Li, Yuqiang, Tang, Shixiang, Ouyang, Wanli, Cambria, Erik, Zhou, Dongzhan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
by: Yang, Zonglin, et al.
Published: (2025)
by: Yang, Zonglin, et al.
Published: (2025)
MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback
by: Liu, Wanhao, et al.
Published: (2025)
by: Liu, Wanhao, et al.
Published: (2025)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
by: Yang, Zonglin, et al.
Published: (2024)
by: Yang, Zonglin, et al.
Published: (2024)
MLLM-based Discovery of Intrinsic Coordinates and Governing Equations from High-Dimensional Data
by: Li, Ruikun, et al.
Published: (2025)
by: Li, Ruikun, et al.
Published: (2025)
MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier
by: Yang, Zonglin, et al.
Published: (2026)
by: Yang, Zonglin, et al.
Published: (2026)
AFBench: A Large-scale Benchmark for Airfoil Design
by: Liu, Jian, et al.
Published: (2024)
by: Liu, Jian, et al.
Published: (2024)
CheMatAgent: Enhancing LLMs for Chemistry and Materials Science through Tree-Search Based Tool Learning
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025)
by: Wang, Saizhuo, et al.
Published: (2025)
Logical Reasoning over Natural Language as Knowledge Representation: A Survey
by: Yang, Zonglin, et al.
Published: (2023)
by: Yang, Zonglin, et al.
Published: (2023)
Pixel2Phys: Distilling Governing Laws from Visual Dynamics
by: Li, Ruikun, et al.
Published: (2026)
by: Li, Ruikun, et al.
Published: (2026)
Finetuning Large Language Model as an Effective Symbolic Regressor
by: Hua, Yingfan, et al.
Published: (2025)
by: Hua, Yingfan, et al.
Published: (2025)
EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
by: Sugiura, Issa, et al.
Published: (2025)
by: Sugiura, Issa, et al.
Published: (2025)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
by: Lu, Yuxing, et al.
Published: (2025)
by: Lu, Yuxing, et al.
Published: (2025)
Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance
by: Benhenda, Mostapha
Published: (2026)
by: Benhenda, Mostapha
Published: (2026)
SELT: Self-Evaluation Tree Search for LLMs with Task Decomposition
by: Wu, Mengsong, et al.
Published: (2025)
by: Wu, Mengsong, et al.
Published: (2025)
Chem3DLLM: 3D Multimodal Large Language Models for Chemistry
by: Jiang, Lei, et al.
Published: (2025)
by: Jiang, Lei, et al.
Published: (2025)
Physical formula enhanced multi-task learning for pharmacokinetics prediction
by: Li, Ruifeng, et al.
Published: (2024)
by: Li, Ruifeng, et al.
Published: (2024)
Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks
by: Bigeard, Antoine, et al.
Published: (2025)
by: Bigeard, Antoine, et al.
Published: (2025)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
by: Agrawal, Yogesh, et al.
Published: (2026)
by: Agrawal, Yogesh, et al.
Published: (2026)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
by: Yang, Zonglin, et al.
Published: (2023)
by: Yang, Zonglin, et al.
Published: (2023)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
An Integrated Machine Learning and Deep Learning Framework for Credit Card Approval Prediction
by: Tong, Kejian, et al.
Published: (2024)
by: Tong, Kejian, et al.
Published: (2024)
FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations
by: Hu, Xuesi, et al.
Published: (2026)
by: Hu, Xuesi, et al.
Published: (2026)
DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
by: Li, Yinsheng, et al.
Published: (2025)
by: Li, Yinsheng, et al.
Published: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
A Unified Data-Driven Framework for Efficient Scientific Discovery
by: Xiao, Tingxiong, et al.
Published: (2025)
by: Xiao, Tingxiong, et al.
Published: (2025)
Scientific Machine Learning-assisted Model Discovery from Telemetry Data
by: Micluta-Campeanu, Sebastian, et al.
Published: (2026)
by: Micluta-Campeanu, Sebastian, et al.
Published: (2026)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024)
by: Guo, Sikun, et al.
Published: (2024)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026)
by: Kumar, Mahesh, et al.
Published: (2026)
Energy-Efficient Robust Beamforming for Multi-Functional RIS-Aided Wireless Communication under Imperfect CSI
by: Zheng, Ailing, et al.
Published: (2024)
by: Zheng, Ailing, et al.
Published: (2024)
LOB-Bench: Benchmarking Generative AI for Finance -- an Application to Limit Order Book Data
by: Nagy, Peer, et al.
Published: (2025)
by: Nagy, Peer, et al.
Published: (2025)
Chem-R: Learning to Reason as a Chemist
by: Wang, Weida, et al.
Published: (2025)
by: Wang, Weida, et al.
Published: (2025)
From Query to Explanation: Uni-RAG for Multi-Modal Retrieval-Augmented Learning in STEM
by: Wu, Xinyi, et al.
Published: (2025)
by: Wu, Xinyi, et al.
Published: (2025)
Common Task Framework For a Critical Evaluation of Scientific Machine Learning Algorithms
by: Wyder, Philippe Martin, et al.
Published: (2025)
by: Wyder, Philippe Martin, et al.
Published: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
by: Yang, Yuzhe, et al.
Published: (2024)
by: Yang, Yuzhe, et al.
Published: (2024)
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
Leveraging LLMS for Top-Down Sector Allocation In Automated Trading
by: Heng, Ryan Quek Wei, et al.
Published: (2025)
by: Heng, Ryan Quek Wei, et al.
Published: (2025)
Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation
by: Wu, Weimin, et al.
Published: (2025)
by: Wu, Weimin, et al.
Published: (2025)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
by: Huang, Jimin, et al.
Published: (2024)
by: Huang, Jimin, et al.
Published: (2024)
Similar Items
-
MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
by: Yang, Zonglin, et al.
Published: (2025) -
MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback
by: Liu, Wanhao, et al.
Published: (2025) -
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
by: Yang, Zonglin, et al.
Published: (2024) -
MLLM-based Discovery of Intrinsic Coordinates and Governing Equations from High-Dimensional Data
by: Li, Ruikun, et al.
Published: (2025) -
MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier
by: Yang, Zonglin, et al.
Published: (2026)