Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Bingyang, Chen, Shan, Tu, Jingxuan, Liu, Chen, Xiong, Zidi, Schmidgall, Samuel, Bitterman, Danielle S. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Linguistically Conditioned Semantic Textual Similarity
di: Tu, Jingxuan, et al.
Pubblicazione: (2024)
di: Tu, Jingxuan, et al.
Pubblicazione: (2024)
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
di: Schopf, Tim, et al.
Pubblicazione: (2026)
di: Schopf, Tim, et al.
Pubblicazione: (2026)
Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification
di: Chen, Shan, et al.
Pubblicazione: (2023)
di: Chen, Shan, et al.
Pubblicazione: (2023)
AgentRxiv: Towards Collaborative Autonomous Research
di: Schmidgall, Samuel, et al.
Pubblicazione: (2025)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2025)
When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy
di: Qi, Jirui, et al.
Pubblicazione: (2025)
di: Qi, Jirui, et al.
Pubblicazione: (2025)
FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
Sparse Autoencoder Features for Classifications and Transferability
di: Gallifant, Jack, et al.
Pubblicazione: (2025)
di: Gallifant, Jack, et al.
Pubblicazione: (2025)
KScope: A Framework for Characterizing the Knowledge Status of Language Models
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
di: Xiao, Yuxin, et al.
Pubblicazione: (2025)
User-Assistant Bias in LLMs
di: Pan, Xu, et al.
Pubblicazione: (2025)
di: Pan, Xu, et al.
Pubblicazione: (2025)
Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context
di: Ruan, Kai, et al.
Pubblicazione: (2024)
di: Ruan, Kai, et al.
Pubblicazione: (2024)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
di: Su, Weihang, et al.
Pubblicazione: (2025)
di: Su, Weihang, et al.
Pubblicazione: (2025)
Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems
di: Peng, Yebo, et al.
Pubblicazione: (2025)
di: Peng, Yebo, et al.
Pubblicazione: (2025)
Position Paper On Diagnostic Uncertainty Estimation from Large Language Models: Next-Word Probability Is Not Pre-test Probability
di: Gao, Yanjun, et al.
Pubblicazione: (2024)
di: Gao, Yanjun, et al.
Pubblicazione: (2024)
When Raw Data Prevails: Are Large Language Model Embeddings Effective in Numerical Data Representation for Medical Machine Learning Applications?
di: Gao, Yanjun, et al.
Pubblicazione: (2024)
di: Gao, Yanjun, et al.
Pubblicazione: (2024)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
di: Guo, Sikun, et al.
Pubblicazione: (2024)
di: Guo, Sikun, et al.
Pubblicazione: (2024)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
SciPIP: An LLM-based Scientific Paper Idea Proposer
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
MedBrowseComp: Benchmarking Medical Deep Research and Computer Use
di: Chen, Shan, et al.
Pubblicazione: (2025)
di: Chen, Shan, et al.
Pubblicazione: (2025)
FML-bench: Benchmarking Machine Learning Agents for Scientific Research
di: Zou, Qiran, et al.
Pubblicazione: (2025)
di: Zou, Qiran, et al.
Pubblicazione: (2025)
Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation
di: Gao, Songyang, et al.
Pubblicazione: (2026)
di: Gao, Songyang, et al.
Pubblicazione: (2026)
MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific Workflows
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
Athena: Retrieval-augmented Legal Judgment Prediction with Large Language Models
di: Peng, Xiao, et al.
Pubblicazione: (2024)
di: Peng, Xiao, et al.
Pubblicazione: (2024)
Beyond Brainstorming: What Drives High-Quality Scientific Ideas? Lessons from Multi-Agent Collaboration
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
di: Xu, Wanghan, et al.
Pubblicazione: (2025)
di: Xu, Wanghan, et al.
Pubblicazione: (2025)
Evaluating and Optimizing Educational Content with Large Language Model Judgments
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
di: He-Yueya, Joy, et al.
Pubblicazione: (2024)
Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge
di: Chen, Luyu, et al.
Pubblicazione: (2025)
di: Chen, Luyu, et al.
Pubblicazione: (2025)
PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm
di: Li, Jing-Jing, et al.
Pubblicazione: (2026)
di: Li, Jing-Jing, et al.
Pubblicazione: (2026)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
di: Su, Weihang, et al.
Pubblicazione: (2025)
di: Su, Weihang, et al.
Pubblicazione: (2025)
AnnoCaseLaw: A Richly-Annotated Dataset For Benchmarking Explainable Legal Judgment Prediction
di: Sesodia, Magnus, et al.
Pubblicazione: (2025)
di: Sesodia, Magnus, et al.
Pubblicazione: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
ReviewRL: Towards Automated Scientific Review with RL
di: Zeng, Sihang, et al.
Pubblicazione: (2025)
di: Zeng, Sihang, et al.
Pubblicazione: (2025)
From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge
di: Li, Dawei, et al.
Pubblicazione: (2024)
di: Li, Dawei, et al.
Pubblicazione: (2024)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
di: Chen, Lu, et al.
Pubblicazione: (2024)
di: Chen, Lu, et al.
Pubblicazione: (2024)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
di: Chen, Haotian, et al.
Pubblicazione: (2025)
di: Chen, Haotian, et al.
Pubblicazione: (2025)
Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
di: Ye, Wengao, et al.
Pubblicazione: (2025)
di: Ye, Wengao, et al.
Pubblicazione: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
The Veln(ia)s is in the Details: Evaluating LLM Judgment on Latvian and Lithuanian Short Answer Matching
di: Kostiuk, Yevhen, et al.
Pubblicazione: (2025)
di: Kostiuk, Yevhen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Linguistically Conditioned Semantic Textual Similarity
di: Tu, Jingxuan, et al.
Pubblicazione: (2024) -
Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas
di: Schopf, Tim, et al.
Pubblicazione: (2026) -
Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification
di: Chen, Shan, et al.
Pubblicazione: (2023) -
AgentRxiv: Towards Collaborative Autonomous Research
di: Schmidgall, Samuel, et al.
Pubblicazione: (2025) -
When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy
di: Qi, Jirui, et al.
Pubblicazione: (2025)