ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Yuqi, Yu, Jing, Su, Zichang, Feng, Kehua, Zhu, Zhihui, Wang, Libin, Liang, Lei, Zhang, Qiang, Ding, Keyan, Chen, Huajun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025)
by: Feng, Kehua, et al.
Published: (2025)
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
by: Yu, Jing, et al.
Published: (2025)
by: Yu, Jing, et al.
Published: (2025)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026)
by: Rao, Mingyang, et al.
Published: (2026)
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025)
by: Tang, Yuqi, et al.
Published: (2025)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
by: Luo, Shunyang, et al.
Published: (2026)
by: Luo, Shunyang, et al.
Published: (2026)
SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning
by: Feng, Kehua, et al.
Published: (2025)
by: Feng, Kehua, et al.
Published: (2025)
Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
by: Zhuang, Xiang, et al.
Published: (2025)
by: Zhuang, Xiang, et al.
Published: (2025)
Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition
by: Feng, Kehua, et al.
Published: (2024)
by: Feng, Kehua, et al.
Published: (2024)
Enhancing Safe and Controllable Protein Generation via Knowledge Preference Optimization
by: Wang, Yuhao, et al.
Published: (2025)
by: Wang, Yuhao, et al.
Published: (2025)
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
by: Zhuang, Xiang, et al.
Published: (2026)
by: Zhuang, Xiang, et al.
Published: (2026)
Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
by: Lyu, Tianwen, et al.
Published: (2025)
by: Lyu, Tianwen, et al.
Published: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
by: Ding, Keyan, et al.
Published: (2025)
by: Ding, Keyan, et al.
Published: (2025)
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
Advancing biomolecular understanding and design following human instructions
by: Zhuang, Xiang, et al.
Published: (2024)
by: Zhuang, Xiang, et al.
Published: (2024)
ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
by: Li, Yuchong, et al.
Published: (2025)
by: Li, Yuchong, et al.
Published: (2025)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
by: Wu, Juncheng, et al.
Published: (2026)
by: Wu, Juncheng, et al.
Published: (2026)
LiveClin: A Live Clinical Benchmark without Leakage
by: Wang, Xidong, et al.
Published: (2026)
by: Wang, Xidong, et al.
Published: (2026)
DEF: Diffusion-augmented Ensemble Forecasting
by: Millard, David, et al.
Published: (2025)
by: Millard, David, et al.
Published: (2025)
UnityGraph: Unified Learning of Spatio-temporal features for Multi-person Motion Prediction
by: Qu, Kehua, et al.
Published: (2024)
by: Qu, Kehua, et al.
Published: (2024)
Relation Learning and Aggregate-attention for Multi-person Motion Prediction
by: Qu, Kehua, et al.
Published: (2024)
by: Qu, Kehua, et al.
Published: (2024)
Multi-Stage Patient Role-Playing Framework for Realistic Clinical Interactions
by: Jiang, Shijie, et al.
Published: (2026)
by: Jiang, Shijie, et al.
Published: (2026)
Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra
by: Zhang, Yiwen, et al.
Published: (2025)
by: Zhang, Yiwen, et al.
Published: (2025)
ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
by: Zheng, Xiang, et al.
Published: (2026)
by: Zheng, Xiang, et al.
Published: (2026)
ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making
by: Watanabe, Yusuke, et al.
Published: (2026)
by: Watanabe, Yusuke, et al.
Published: (2026)
ClinConNet: A Blockchain-based Dynamic Consent Management Platform for Clinical Research
by: Naghmouchi, Montassar, et al.
Published: (2026)
by: Naghmouchi, Montassar, et al.
Published: (2026)
ClinStructor: AI-Powered Structuring of Unstructured Clinical Texts
by: K, Karthikeyan, et al.
Published: (2025)
by: K, Karthikeyan, et al.
Published: (2025)
InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem
by: Qiao, Shuofei, et al.
Published: (2026)
by: Qiao, Shuofei, et al.
Published: (2026)
Good minimal models with nowhere vanishing holomorphic $1$-forms
by: Hao, Feng, et al.
Published: (2024)
by: Hao, Feng, et al.
Published: (2024)
LightThinker++: From Reasoning Compression to Memory Management
by: Zhu, Yuqi, et al.
Published: (2026)
by: Zhu, Yuqi, et al.
Published: (2026)
ClinLinker: Medical Entity Linking of Clinical Concept Mentions in Spanish
by: Gallego, Fernando, et al.
Published: (2024)
by: Gallego, Fernando, et al.
Published: (2024)
ClinAlign: Scaling Healthcare Alignment from Clinician Preference
by: Lyu, Shiwei, et al.
Published: (2026)
by: Lyu, Shiwei, et al.
Published: (2026)
Literature Data Table TMCF soils DEF v.2
by: Luis G., García-Montero
Published: (2026)
by: Luis G., García-Montero
Published: (2026)
Antibiotic Resistance, Biofilm Genes, and smeDEF Efflux Pump in Clinical Stenotrophomonas maltophilia Isolates From Iran
by: Haneen Fadhil Jasim, et al.
Published: (2026)
by: Haneen Fadhil Jasim, et al.
Published: (2026)
LLMs for Knowledge Graph Construction and Reasoning: Recent Capabilities and Future Opportunities
by: Zhu, Yuqi, et al.
Published: (2023)
by: Zhu, Yuqi, et al.
Published: (2023)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
by: Zhang, Zefan, et al.
Published: (2026)
by: Zhang, Zefan, et al.
Published: (2026)
DEF_PURPOSE - Immutable Alignment Drift Prevention Mechanism for LLM Architectures
by: Ochej, Stéphane
Published: (2026)
by: Ochej, Stéphane
Published: (2026)
DEF-YOLO: Leveraging YOLO for Concealed Weapon Detection in Thermal Imagin
by: Bhardwaj, Divya, et al.
Published: (2025)
by: Bhardwaj, Divya, et al.
Published: (2025)
ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding
by: Chen, Kehua
Published: (2025)
by: Chen, Kehua
Published: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
by: Liu, Xiwei, et al.
Published: (2026)
by: Liu, Xiwei, et al.
Published: (2026)
Similar Items
-
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
by: Feng, Kehua, et al.
Published: (2025) -
SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models
by: Yu, Jing, et al.
Published: (2025) -
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
by: Rao, Mingyang, et al.
Published: (2026) -
SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
by: Feng, Kehua, et al.
Published: (2024) -
Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges
by: Tang, Yuqi, et al.
Published: (2025)