SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Jing, Tang, Yuqi, Feng, Kehua, Rao, Mingyang, Liang, Lei, Zhang, Zhiqiang, Sun, Mengshu, Zhang, Wen, Zhang, Qiang, Ding, Keyan, Chen, Huajun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025)
by: Feng, Kehua, et al.
Published: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
by: Ding, Keyan, et al.
Published: (2025)
by: Ding, Keyan, et al.
Published: (2025)
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026)
by: Rao, Mingyang, et al.
Published: (2026)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
by: Liu, Zhiqiang, et al.
Published: (2025)
by: Liu, Zhiqiang, et al.
Published: (2025)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion
by: Liu, Zhiqiang, et al.
Published: (2025)
by: Liu, Zhiqiang, et al.
Published: (2025)
SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
by: Feng, Kehua, et al.
Published: (2025)
by: Feng, Kehua, et al.
Published: (2025)
Enhancing Safe and Controllable Protein Generation via Knowledge Preference Optimization
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
Croppable Knowledge Graph Embedding
by: Zhu, Yushan, et al.
Published: (2024)
by: Zhu, Yushan, et al.
Published: (2024)
Retrieve, Summarize, Plan: Advancing Multi-hop Question Answering with an Iterative Approach
by: Jiang, Zhouyu, et al.
Published: (2024)
by: Jiang, Zhouyu, et al.
Published: (2024)
Bi'an: A Bilingual Benchmark and Model for Hallucination Detection in Retrieval-Augmented Generation
by: Jiang, Zhouyu, et al.
Published: (2025)
by: Jiang, Zhouyu, et al.
Published: (2025)
Have We Designed Generalizable Structural Knowledge Promptings? Systematic Evaluation and Rethinking
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
by: Zhuang, Xiang, et al.
Published: (2025)
by: Zhuang, Xiang, et al.
Published: (2025)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
OneGen: Efficient One-Pass Unified Generation and Retrieval for LLMs
by: Zhang, Jintian, et al.
Published: (2024)
by: Zhang, Jintian, et al.
Published: (2024)
K-ON: Stacking Knowledge On the Head Layer of Large Language Model
by: Guo, Lingbing, et al.
Published: (2025)
by: Guo, Lingbing, et al.
Published: (2025)
InstructIE: A Bilingual Instruction-based Information Extraction Dataset
by: Gui, Honghao, et al.
Published: (2023)
by: Gui, Honghao, et al.
Published: (2023)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
by: Yuan, Lin, et al.
Published: (2025)
by: Yuan, Lin, et al.
Published: (2025)
OntoTune: Ontology-Driven Self-training for Aligning Large Language Models
by: Liu, Zhiqiang, et al.
Published: (2025)
by: Liu, Zhiqiang, et al.
Published: (2025)
Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
by: Lyu, Tianwen, et al.
Published: (2025)
by: Lyu, Tianwen, et al.
Published: (2025)
Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
SciTS: Scientific Time Series Understanding and Generation with LLMs
by: Wu, Wen, et al.
Published: (2025)
by: Wu, Wen, et al.
Published: (2025)
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
by: Zhuang, Xiang, et al.
Published: (2026)
by: Zhuang, Xiang, et al.
Published: (2026)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
by: Luo, Shunyang, et al.
Published: (2026)
by: Luo, Shunyang, et al.
Published: (2026)
IEPile: Unearthing Large-Scale Schema-Based Information Extraction Corpus
by: Gui, Honghao, et al.
Published: (2024)
by: Gui, Honghao, et al.
Published: (2024)
RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Models
by: Gong, Zhaoyan, et al.
Published: (2025)
by: Gong, Zhaoyan, et al.
Published: (2025)
SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning
by: Yu, Wenhan, et al.
Published: (2025)
by: Yu, Wenhan, et al.
Published: (2025)
Advancing biomolecular understanding and design following human instructions
by: Zhuang, Xiang, et al.
Published: (2024)
by: Zhuang, Xiang, et al.
Published: (2024)
SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
by: Singh, Shruti, et al.
Published: (2024)
by: Singh, Shruti, et al.
Published: (2024)
MKGL: Mastery of a Three-Word Language
by: Guo, Lingbing, et al.
Published: (2024)
by: Guo, Lingbing, et al.
Published: (2024)
MAQInstruct: Instruction-based Unified Event Relation Extraction
by: Xu, Jun, et al.
Published: (2025)
by: Xu, Jun, et al.
Published: (2025)
ChatUIE: Exploring Chat-based Unified Information Extraction using Large Language Models
by: Xu, Jun, et al.
Published: (2024)
by: Xu, Jun, et al.
Published: (2024)
LightThinker: Thinking Step-by-Step Compression
by: Zhang, Jintian, et al.
Published: (2025)
by: Zhang, Jintian, et al.
Published: (2025)
SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents
by: Zhang, Qi, et al.
Published: (2024)
by: Zhang, Qi, et al.
Published: (2024)
ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding
by: Chen, Kehua
Published: (2025)
by: Chen, Kehua
Published: (2025)
Unleashing the Power of Imbalanced Modality Information for Multi-modal Knowledge Graph Completion
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Similar Items
-
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
by: Feng, Kehua, et al.
Published: (2024) -
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025) -
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
by: Ding, Keyan, et al.
Published: (2025) -
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
by: Tang, Yuqi, et al.
Published: (2025) -
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026)