ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Tianze, Lu, Pengrui, Ye, Lyumanshan, Hu, Xiangkun, Liu, Pengfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
di: Wu, Yunze, et al.
Pubblicazione: (2025)
di: Wu, Yunze, et al.
Pubblicazione: (2025)
AlphaGo Moment for Model Architecture Discovery
di: Liu, Yixiu, et al.
Pubblicazione: (2025)
di: Liu, Yixiu, et al.
Pubblicazione: (2025)
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
di: Lu, Pengrui, et al.
Pubblicazione: (2026)
Deep Research Bench: Evaluating AI Web Research Agents
di: FutureSearch, et al.
Pubblicazione: (2025)
di: FutureSearch, et al.
Pubblicazione: (2025)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
di: Xu, Tianze, et al.
Pubblicazione: (2026)
di: Xu, Tianze, et al.
Pubblicazione: (2026)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
di: Xiong, Lei, et al.
Pubblicazione: (2026)
di: Xiong, Lei, et al.
Pubblicazione: (2026)
ASI-Evolve: AI Accelerates AI
di: Xu, Weixian, et al.
Pubblicazione: (2026)
di: Xu, Weixian, et al.
Pubblicazione: (2026)
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
di: Li, Keyu, et al.
Pubblicazione: (2025)
di: Li, Keyu, et al.
Pubblicazione: (2025)
Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training
di: Fu, Dayuan, et al.
Pubblicazione: (2025)
di: Fu, Dayuan, et al.
Pubblicazione: (2025)
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents
di: Lupidi, Alisia, et al.
Pubblicazione: (2026)
di: Lupidi, Alisia, et al.
Pubblicazione: (2026)
Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment Research
di: Haque, Mirazul, et al.
Pubblicazione: (2026)
di: Haque, Mirazul, et al.
Pubblicazione: (2026)
AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
di: Li, Keyu, et al.
Pubblicazione: (2026)
di: Li, Keyu, et al.
Pubblicazione: (2026)
AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
di: Tie, Guiyao, et al.
Pubblicazione: (2026)
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
di: Bragg, Jonathan, et al.
Pubblicazione: (2025)
di: Bragg, Jonathan, et al.
Pubblicazione: (2025)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
PaperBench: Evaluating AI's Ability to Replicate AI Research
di: Starace, Giulio, et al.
Pubblicazione: (2025)
di: Starace, Giulio, et al.
Pubblicazione: (2025)
AI Mathematician: Towards Fully Automated Frontier Mathematical Research
di: Liu, Yuanhang, et al.
Pubblicazione: (2025)
di: Liu, Yuanhang, et al.
Pubblicazione: (2025)
AutoMedBench: Towards Medical AutoResearch with Agentic AI Models
di: Liu, Junqi, et al.
Pubblicazione: (2026)
di: Liu, Junqi, et al.
Pubblicazione: (2026)
XRL-Bench: A Benchmark for Evaluating and Comparing Explainable Reinforcement Learning Techniques
di: Xiong, Yu, et al.
Pubblicazione: (2024)
di: Xiong, Yu, et al.
Pubblicazione: (2024)
FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights
di: Wang, Zhen, et al.
Pubblicazione: (2026)
di: Wang, Zhen, et al.
Pubblicazione: (2026)
Dominion: A New Frontier for AI Research
di: Halawi, Danny, et al.
Pubblicazione: (2024)
di: Halawi, Danny, et al.
Pubblicazione: (2024)
Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
di: Du, Pengfei
Pubblicazione: (2026)
di: Du, Pengfei
Pubblicazione: (2026)
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
di: Li, Changyi, et al.
Pubblicazione: (2026)
di: Li, Changyi, et al.
Pubblicazione: (2026)
FrontierScience: Evaluating AI's Ability to Perform Expert-Level Scientific Tasks
di: Wang, Miles, et al.
Pubblicazione: (2026)
di: Wang, Miles, et al.
Pubblicazione: (2026)
AI-Researcher: Autonomous Scientific Innovation
di: Tang, Jiabin, et al.
Pubblicazione: (2025)
di: Tang, Jiabin, et al.
Pubblicazione: (2025)
EXP-Bench: Can AI Conduct AI Research Experiments?
di: Kon, Patrick Tser Jern, et al.
Pubblicazione: (2025)
di: Kon, Patrick Tser Jern, et al.
Pubblicazione: (2025)
SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Survey
di: Zhang, Guo-Biao, et al.
Pubblicazione: (2026)
di: Zhang, Guo-Biao, et al.
Pubblicazione: (2026)
MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
di: Chen, Hui, et al.
Pubblicazione: (2025)
di: Chen, Hui, et al.
Pubblicazione: (2025)
SR-Scientist: Scientific Equation Discovery With Agentic AI
di: Xia, Shijie, et al.
Pubblicazione: (2025)
di: Xia, Shijie, et al.
Pubblicazione: (2025)
AI4Research: A Survey of Artificial Intelligence for Scientific Research
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
EAIRA: Establishing a Methodology for Evaluating AI Models as Scientific Research Assistants
di: Cappello, Franck, et al.
Pubblicazione: (2025)
di: Cappello, Franck, et al.
Pubblicazione: (2025)
Scientific Algorithm Discovery by Augmenting AlphaEvolve with Deep Research
di: Liu, Gang, et al.
Pubblicazione: (2025)
di: Liu, Gang, et al.
Pubblicazione: (2025)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI
di: Tong, Haibo, et al.
Pubblicazione: (2026)
di: Tong, Haibo, et al.
Pubblicazione: (2026)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
di: Li, Minghao, et al.
Pubblicazione: (2025)
di: Li, Minghao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025) -
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
di: Wu, Yunze, et al.
Pubblicazione: (2025) -
AlphaGo Moment for Model Architecture Discovery
di: Liu, Yixiu, et al.
Pubblicazione: (2025) -
ProjDevBench: Benchmarking AI Coding Agents on End-to-End Project Development
di: Lu, Pengrui, et al.
Pubblicazione: (2026) -
Deep Research Bench: Evaluating AI Web Research Agents
di: FutureSearch, et al.
Pubblicazione: (2025)