IdeaBench: Benchmarking Large Language Models for Research Idea Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Sikun, Shariatmadari, Amir Hassan, Xiong, Guangzhi, Huang, Albert, Xie, Eric, Bekiranov, Stefan, Zhang, Aidong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Scientific Hypothesis Generation with Knowledge Grounded Large Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2024)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2024)
Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
di: Yang, Yuzhe, et al.
Pubblicazione: (2024)
di: Yang, Yuzhe, et al.
Pubblicazione: (2024)
QuantBench: Benchmarking AI Methods for Quantitative Investment
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
LOB-Bench: Benchmarking Generative AI for Finance -- an Application to Limit Order Book Data
di: Nagy, Peer, et al.
Pubblicazione: (2025)
di: Nagy, Peer, et al.
Pubblicazione: (2025)
DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
di: Li, Yinsheng, et al.
Pubblicazione: (2025)
di: Li, Yinsheng, et al.
Pubblicazione: (2025)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
di: Hu, Gang, et al.
Pubblicazione: (2024)
di: Hu, Gang, et al.
Pubblicazione: (2024)
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
di: Liu, Yujie, et al.
Pubblicazione: (2025)
di: Liu, Yujie, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models for Polymer Property Predictions
di: Gupta, Sonakshi, et al.
Pubblicazione: (2025)
di: Gupta, Sonakshi, et al.
Pubblicazione: (2025)
Evaluation and Benchmarking Suite for Financial Large Language Models and Agents
di: Lin, Shengyuan, et al.
Pubblicazione: (2026)
di: Lin, Shengyuan, et al.
Pubblicazione: (2026)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
di: Huang, Jimin, et al.
Pubblicazione: (2024)
di: Huang, Jimin, et al.
Pubblicazione: (2024)
Golden Touchstone: A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
di: Wu, Xiaojun, et al.
Pubblicazione: (2024)
AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
di: Li, Haohang, et al.
Pubblicazione: (2024)
di: Li, Haohang, et al.
Pubblicazione: (2024)
AFBench: A Large-scale Benchmark for Airfoil Design
di: Liu, Jian, et al.
Pubblicazione: (2024)
di: Liu, Jian, et al.
Pubblicazione: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
Cell-o1: Training LLMs to Solve Single-Cell Reasoning Puzzles with Reinforcement Learning
di: Fang, Yin, et al.
Pubblicazione: (2025)
di: Fang, Yin, et al.
Pubblicazione: (2025)
NumLLM: Numeric-Sensitive Large Language Model for Chinese Finance
di: Su, Huan-Yi, et al.
Pubblicazione: (2024)
di: Su, Huan-Yi, et al.
Pubblicazione: (2024)
Idea2Story: An Automated Pipeline for Transforming Research Concepts into Complete Scientific Narratives
di: Xu, Tengyue, et al.
Pubblicazione: (2026)
di: Xu, Tengyue, et al.
Pubblicazione: (2026)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
Randomness as Reference: Benchmark Metric for Optimization in Engineering
di: Ivić, Stefan, et al.
Pubblicazione: (2025)
di: Ivić, Stefan, et al.
Pubblicazione: (2025)
Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks
di: Bigeard, Antoine, et al.
Pubblicazione: (2025)
di: Bigeard, Antoine, et al.
Pubblicazione: (2025)
BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling
di: Jia, Yiyuan, et al.
Pubblicazione: (2026)
di: Jia, Yiyuan, et al.
Pubblicazione: (2026)
MFMDQwen: Multilingual Financial Misinformation Detection Based on Large Language Model
di: Liu, Zhiwei, et al.
Pubblicazione: (2026)
di: Liu, Zhiwei, et al.
Pubblicazione: (2026)
Enterprise Benchmarks for Large Language Model Evaluation
di: Zhang, Bing, et al.
Pubblicazione: (2024)
di: Zhang, Bing, et al.
Pubblicazione: (2024)
FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations
di: Hu, Xuesi, et al.
Pubblicazione: (2026)
di: Hu, Xuesi, et al.
Pubblicazione: (2026)
Large Language Models for Traffic and Transportation Research: Methodologies, State of the Art, and Future Opportunities
di: Yan, Yimo, et al.
Pubblicazione: (2025)
di: Yan, Yimo, et al.
Pubblicazione: (2025)
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Models
di: Kuang, Ziyan, et al.
Pubblicazione: (2025)
di: Kuang, Ziyan, et al.
Pubblicazione: (2025)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
Automatic Ply Partitioning for Laminar Composite Process Planning
di: Garner, Eric, et al.
Pubblicazione: (2025)
di: Garner, Eric, et al.
Pubblicazione: (2025)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
PINNsAgent: Automated PDE Surrogation with Large Language Models
di: Wuwu, Qingpo, et al.
Pubblicazione: (2025)
di: Wuwu, Qingpo, et al.
Pubblicazione: (2025)
Multimodal Language and Graph Learning of Adsorption Configuration in Catalysis
di: Ock, Janghoon, et al.
Pubblicazione: (2024)
di: Ock, Janghoon, et al.
Pubblicazione: (2024)
Automating MD simulations for Proteins using Large language Models: NAMD-Agent
di: Chandrasekhar, Achuth, et al.
Pubblicazione: (2025)
di: Chandrasekhar, Achuth, et al.
Pubblicazione: (2025)
AI-Empowered Catalyst Discovery: A Survey from Classical Machine Learning Approaches to Large Language Models
di: Xu, Yuanyuan, et al.
Pubblicazione: (2025)
di: Xu, Yuanyuan, et al.
Pubblicazione: (2025)
Connectomics Informed by Large Language Models
di: Thompson, Elinor, et al.
Pubblicazione: (2025)
di: Thompson, Elinor, et al.
Pubblicazione: (2025)
BikeBench: A Bicycle Design Benchmark for Generative Models with Objectives and Constraints
di: Regenwetter, Lyle, et al.
Pubblicazione: (2025)
di: Regenwetter, Lyle, et al.
Pubblicazione: (2025)
MMFCTUB: Multi-Modal Financial Credit Table Understanding Benchmark
di: Yakun, Cui, et al.
Pubblicazione: (2026)
di: Yakun, Cui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improving Scientific Hypothesis Generation with Knowledge Grounded Large Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2024) -
Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2025) -
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
di: Yang, Yuzhe, et al.
Pubblicazione: (2024) -
QuantBench: Benchmarking AI Methods for Quantitative Investment
di: Wang, Saizhuo, et al.
Pubblicazione: (2025) -
LOB-Bench: Benchmarking Generative AI for Finance -- an Application to Limit Order Book Data
di: Nagy, Peer, et al.
Pubblicazione: (2025)