CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
Fuente:
arXiv
Saved in:
| Main Authors: | Queen, Owen, Zhang, Harrison G., Zou, James |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ReasonOps: Operator Segmentation for LLM Reasoning Traces
by: Lee, Daniel, et al.
Published: (2026)
by: Lee, Daniel, et al.
Published: (2026)
Exploring the use of AI authors and reviewers at Agents4Science
by: Bianchi, Federico, et al.
Published: (2025)
by: Bianchi, Federico, et al.
Published: (2025)
FML-bench: Benchmarking Machine Learning Agents for Scientific Research
by: Zou, Qiran, et al.
Published: (2025)
by: Zou, Qiran, et al.
Published: (2025)
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025)
by: Yu, Tong, et al.
Published: (2025)
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
by: Kleidermacher, Hannah Calzi, et al.
Published: (2025)
by: Kleidermacher, Hannah Calzi, et al.
Published: (2025)
Disentangling Reasoning and Knowledge in Medical Large Language Models
by: Thapa, Rahul, et al.
Published: (2025)
by: Thapa, Rahul, et al.
Published: (2025)
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
by: Sun, Qianpu, et al.
Published: (2026)
by: Sun, Qianpu, et al.
Published: (2026)
DSGym: A Holistic Framework for Evaluating and Training Data Science Agents
by: Nie, Fan, et al.
Published: (2026)
by: Nie, Fan, et al.
Published: (2026)
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
by: Imani, Shima, et al.
Published: (2025)
by: Imani, Shima, et al.
Published: (2025)
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
by: Imani, Shima, et al.
Published: (2025)
by: Imani, Shima, et al.
Published: (2025)
Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
by: Lee, Kevin, et al.
Published: (2025)
by: Lee, Kevin, et al.
Published: (2025)
DIAGPaper: Diagnosing Valid and Specific Weaknesses in Scientific Papers via Multi-Agent Reasoning
by: Zou, Zhuoyang, et al.
Published: (2026)
by: Zou, Zhuoyang, et al.
Published: (2026)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
by: Ma, Yubo, et al.
Published: (2024)
by: Ma, Yubo, et al.
Published: (2024)
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
by: Wang, Daoyu, et al.
Published: (2025)
by: Wang, Daoyu, et al.
Published: (2025)
Rethinking and Benchmarking Large Language Models for Graph Reasoning
by: Hu, Yuwei, et al.
Published: (2025)
by: Hu, Yuwei, et al.
Published: (2025)
$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation
by: Zhang, Jian, et al.
Published: (2026)
by: Zhang, Jian, et al.
Published: (2026)
AI Knowledge and Reasoning: Emulating Expert Creativity in Scientific Research
by: Mukherjee, Anirban, et al.
Published: (2024)
by: Mukherjee, Anirban, et al.
Published: (2024)
UniTS: A Unified Multi-Task Time Series Model
by: Gao, Shanghua, et al.
Published: (2024)
by: Gao, Shanghua, et al.
Published: (2024)
MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research
by: Burgess, James, et al.
Published: (2025)
by: Burgess, James, et al.
Published: (2025)
The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency
by: Wang, Dingyu, et al.
Published: (2025)
by: Wang, Dingyu, et al.
Published: (2025)
Understanding LLM Scientific Reasoning through Promptings and Model's Explanation on the Answers
by: Rueda, Alice, et al.
Published: (2025)
by: Rueda, Alice, et al.
Published: (2025)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
by: Tie, Guiyao, et al.
Published: (2025)
by: Tie, Guiyao, et al.
Published: (2025)
Who Gets Cited Most? Benchmarking Long-Context Numerical Reasoning on Scientific Articles
by: Li, Miao, et al.
Published: (2025)
by: Li, Miao, et al.
Published: (2025)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
by: Xiong, Lei, et al.
Published: (2026)
by: Xiong, Lei, et al.
Published: (2026)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
by: Zhu, Yakun, et al.
Published: (2025)
by: Zhu, Yakun, et al.
Published: (2025)
Oedipus and the Sphinx: Benchmarking and Improving Visual Language Models for Complex Graphic Reasoning
by: Zhang, Jianyi, et al.
Published: (2025)
by: Zhang, Jianyi, et al.
Published: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
by: Deng, Andong, et al.
Published: (2025)
by: Deng, Andong, et al.
Published: (2025)
Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games
by: Su, Chris, et al.
Published: (2025)
by: Su, Chris, et al.
Published: (2025)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
by: Chang, Yifan, et al.
Published: (2025)
by: Chang, Yifan, et al.
Published: (2025)
QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi
by: Cohn, Anthony G., et al.
Published: (2026)
by: Cohn, Anthony G., et al.
Published: (2026)
Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification
by: Masri, Yahya, et al.
Published: (2026)
by: Masri, Yahya, et al.
Published: (2026)
MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
by: Jiang, Mohan, et al.
Published: (2025)
by: Jiang, Mohan, et al.
Published: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
by: Zheng, Tianshi, et al.
Published: (2026)
by: Zheng, Tianshi, et al.
Published: (2026)
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
by: Yan, Yibo, et al.
Published: (2025)
by: Yan, Yibo, et al.
Published: (2025)
Large Language Models in the Clinic: A Comprehensive Benchmark
by: Liu, Fenglin, et al.
Published: (2024)
by: Liu, Fenglin, et al.
Published: (2024)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
by: Zhang, Junkai, et al.
Published: (2025)
by: Zhang, Junkai, et al.
Published: (2025)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
by: Yu, Zhouliang, et al.
Published: (2025)
by: Yu, Zhouliang, et al.
Published: (2025)
Leveraging Large Language Model as Simulated Patients for Clinical Education
by: Li, Yanzeng, et al.
Published: (2024)
by: Li, Yanzeng, et al.
Published: (2024)
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
by: Kwon, Yongchan, et al.
Published: (2025)
by: Kwon, Yongchan, et al.
Published: (2025)
Similar Items
-
ReasonOps: Operator Segmentation for LLM Reasoning Traces
by: Lee, Daniel, et al.
Published: (2026) -
Exploring the use of AI authors and reviewers at Agents4Science
by: Bianchi, Federico, et al.
Published: (2025) -
FML-bench: Benchmarking Machine Learning Agents for Scientific Research
by: Zou, Qiran, et al.
Published: (2025) -
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025) -
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
by: Kleidermacher, Hannah Calzi, et al.
Published: (2025)