AI Idea Bench 2025: AI Research Idea Generation Benchmark
Fuente:
arXiv
Saved in:
| Main Authors: | Qiu, Yansheng, Zhang, Haoquan, Xu, Zhaopan, Li, Ming, Song, Diping, Wang, Zheng, Zhang, Kaipeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024)
by: Guo, Sikun, et al.
Published: (2024)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
by: Qiu, Yansheng, et al.
Published: (2025)
by: Qiu, Yansheng, et al.
Published: (2025)
GoAI: Enhancing AI Students' Learning Paths and Idea Generation via Graph of AI Ideas
by: Gao, Xian, et al.
Published: (2025)
by: Gao, Xian, et al.
Published: (2025)
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
by: Schopf, Tim, et al.
Published: (2026)
by: Schopf, Tim, et al.
Published: (2026)
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
by: Li, Long, et al.
Published: (2024)
by: Li, Long, et al.
Published: (2024)
LDC: Learning to Generate Research Idea with Dynamic Control
by: Li, Ruochen, et al.
Published: (2024)
by: Li, Ruochen, et al.
Published: (2024)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
by: Zhou, Pengfei, et al.
Published: (2025)
by: Zhou, Pengfei, et al.
Published: (2025)
Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation
by: Gao, Songyang, et al.
Published: (2026)
by: Gao, Songyang, et al.
Published: (2026)
How AI Ideas Affect the Creativity, Diversity, and Evolution of Human Ideas: Evidence From a Large, Dynamic Experiment
by: Ashkinaze, Joshua, et al.
Published: (2024)
by: Ashkinaze, Joshua, et al.
Published: (2024)
InMind: Evaluating LLMs in Capturing and Applying Individual Human Reasoning Styles
by: Li, Zizhen, et al.
Published: (2025)
by: Li, Zizhen, et al.
Published: (2025)
Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments
by: Ye, Bingyang, et al.
Published: (2026)
by: Ye, Bingyang, et al.
Published: (2026)
PyVision: Agentic Vision with Dynamic Tooling
by: Zhao, Shitian, et al.
Published: (2025)
by: Zhao, Shitian, et al.
Published: (2025)
Nova: An Iterative Planning and Search Approach to Enhance Novelty and Diversity of LLM Generated Ideas
by: Hu, Xiang, et al.
Published: (2024)
by: Hu, Xiang, et al.
Published: (2024)
Good Idea or Not, Representation of LLM Could Tell
by: Xu, Yi, et al.
Published: (2024)
by: Xu, Yi, et al.
Published: (2024)
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
by: Bragg, Jonathan, et al.
Published: (2025)
by: Bragg, Jonathan, et al.
Published: (2025)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
by: Zhou, Pengfei, et al.
Published: (2025)
by: Zhou, Pengfei, et al.
Published: (2025)
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
by: Deng, Hexuan, et al.
Published: (2026)
by: Deng, Hexuan, et al.
Published: (2026)
Algorithm of Thoughts: Enhancing Exploration of Ideas in Large Language Models
by: Sel, Bilgehan, et al.
Published: (2023)
by: Sel, Bilgehan, et al.
Published: (2023)
PaperBench: Evaluating AI's Ability to Replicate AI Research
by: Starace, Giulio, et al.
Published: (2025)
by: Starace, Giulio, et al.
Published: (2025)
WritingBench: A Comprehensive Benchmark for Generative Writing
by: Wu, Yuning, et al.
Published: (2025)
by: Wu, Yuning, et al.
Published: (2025)
Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
by: Ruan, Kai, et al.
Published: (2024)
by: Ruan, Kai, et al.
Published: (2024)
Prompting Diverse Ideas: Increasing AI Idea Variance
by: Meincke, Lennart, et al.
Published: (2024)
by: Meincke, Lennart, et al.
Published: (2024)
RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension
by: Chen, Yelin, et al.
Published: (2026)
by: Chen, Yelin, et al.
Published: (2026)
HindSight: Evaluating LLM-Generated Research Ideas via Future Impact
by: Jiang, Bo
Published: (2026)
by: Jiang, Bo
Published: (2026)
ScholarEval: Research Idea Evaluation Grounded in Literature
by: Moussa, Hanane Nour, et al.
Published: (2025)
by: Moussa, Hanane Nour, et al.
Published: (2025)
Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies
by: Chen, Shuai, et al.
Published: (2026)
by: Chen, Shuai, et al.
Published: (2026)
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
by: Karger, Ezra, et al.
Published: (2024)
by: Karger, Ezra, et al.
Published: (2024)
ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models
by: Baek, Jinheon, et al.
Published: (2024)
by: Baek, Jinheon, et al.
Published: (2024)
AI and Generative AI for Research Discovery and Summarization
by: Glickman, Mark, et al.
Published: (2024)
by: Glickman, Mark, et al.
Published: (2024)
DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
by: Huang, Yao, et al.
Published: (2025)
by: Huang, Yao, et al.
Published: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
by: Shen, Yongliang, et al.
Published: (2023)
by: Shen, Yongliang, et al.
Published: (2023)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
by: Wang, Qiyao, et al.
Published: (2026)
by: Wang, Qiyao, et al.
Published: (2026)
From Bytes to Ideas: Language Modeling with Autoregressive U-Nets
by: Videau, Mathurin, et al.
Published: (2025)
by: Videau, Mathurin, et al.
Published: (2025)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
by: Zhang, Yuxuan, et al.
Published: (2026)
by: Zhang, Yuxuan, et al.
Published: (2026)
Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
by: Prandi, Matteo, et al.
Published: (2025)
by: Prandi, Matteo, et al.
Published: (2025)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
by: He, Muyu, et al.
Published: (2026)
by: He, Muyu, et al.
Published: (2026)
Connecting Ideas in 'Lower-Resource' Scenarios: NLP for National Varieties, Creoles and Other Low-resource Scenarios
by: Joshi, Aditya, et al.
Published: (2024)
by: Joshi, Aditya, et al.
Published: (2024)
EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research
by: Yue, Houping, et al.
Published: (2026)
by: Yue, Houping, et al.
Published: (2026)
Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation
by: Mule, Srujan P, et al.
Published: (2026)
by: Mule, Srujan P, et al.
Published: (2026)
Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation
by: Chen, Nuo, et al.
Published: (2026)
by: Chen, Nuo, et al.
Published: (2026)
Similar Items
-
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
by: Guo, Sikun, et al.
Published: (2024) -
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
by: Qiu, Yansheng, et al.
Published: (2025) -
GoAI: Enhancing AI Students' Learning Paths and Idea Generation via Graph of AI Ideas
by: Gao, Xian, et al.
Published: (2025) -
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
by: Schopf, Tim, et al.
Published: (2026) -
Chain of Ideas: Revolutionizing Research Via Novel Idea Development with LLM Agents
by: Li, Long, et al.
Published: (2024)