How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Minh-Vuong, Shiri, Fatemeh, Li, Zhuang, Verspoor, Karin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
by: Li, Haoyang, et al.
Published: (2025)
by: Li, Haoyang, et al.
Published: (2025)
Principles from Clinical Research for NLP Model Generalization
by: Elangovan, Aparna, et al.
Published: (2023)
by: Elangovan, Aparna, et al.
Published: (2023)
Direct Evaluation of Chain-of-Thought in Multi-hop Reasoning with Knowledge Graphs
by: Nguyen, Minh-Vuong, et al.
Published: (2024)
by: Nguyen, Minh-Vuong, et al.
Published: (2024)
EMBRE: Entity-aware Masking for Biomedical Relation Extraction
by: Li, Mingjie, et al.
Published: (2024)
by: Li, Mingjie, et al.
Published: (2024)
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
by: Do, Quyet V., et al.
Published: (2026)
by: Do, Quyet V., et al.
Published: (2026)
RADS: Reinforcement Learning-Based Sample Selection Improves Transfer Learning in Low-resource and Imbalanced Clinical Settings
by: Han, Wei, et al.
Published: (2026)
by: Han, Wei, et al.
Published: (2026)
Bayesian Network Fusion of Large Language Models for Sentiment Analysis
by: Amirzadeh, Rasoul, et al.
Published: (2025)
by: Amirzadeh, Rasoul, et al.
Published: (2025)
Learning Robust Negation Text Representations
by: Truong, Thinh Hung, et al.
Published: (2025)
by: Truong, Thinh Hung, et al.
Published: (2025)
Revealing the Numeracy Gap: An Empirical Investigation of Text Embedding Models
by: Deng, Ningyuan, et al.
Published: (2025)
by: Deng, Ningyuan, et al.
Published: (2025)
Exploring Internal Numeracy in Language Models: A Case Study on ALBERT
by: Wennberg, Ulme, et al.
Published: (2024)
by: Wennberg, Ulme, et al.
Published: (2024)
Enhancing Legal Document Retrieval: A Multi-Phase Approach with Large Language Models
by: Nguyen, Hai-Long, et al.
Published: (2024)
by: Nguyen, Hai-Long, et al.
Published: (2024)
Disentangling Memory and Reasoning Ability in Large Language Models
by: Jin, Mingyu, et al.
Published: (2024)
by: Jin, Mingyu, et al.
Published: (2024)
Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases
by: Qiu, Pengcheng, et al.
Published: (2025)
by: Qiu, Pengcheng, et al.
Published: (2025)
Simultaneous Machine Translation with Large Language Models
by: Wang, Minghan, et al.
Published: (2023)
by: Wang, Minghan, et al.
Published: (2023)
ICLEval: Evaluating In-Context Learning Ability of Large Language Models
by: Chen, Wentong, et al.
Published: (2024)
by: Chen, Wentong, et al.
Published: (2024)
Are Emergent Abilities in Large Language Models just In-Context Learning?
by: Lu, Sheng, et al.
Published: (2023)
by: Lu, Sheng, et al.
Published: (2023)
How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
by: Zhang, Zhexin, et al.
Published: (2025)
by: Zhang, Zhexin, et al.
Published: (2025)
A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
by: Yang, Tao, et al.
Published: (2025)
by: Yang, Tao, et al.
Published: (2025)
LEME: Open Large Language Models for Ophthalmology with Advanced Reasoning and Clinical Validation
by: Kim, Hyunjae, et al.
Published: (2024)
by: Kim, Hyunjae, et al.
Published: (2024)
Evaluating the Presence of Sex Bias in Clinical Reasoning by Large Language Models
by: Tsintsiper, Isabel, et al.
Published: (2026)
by: Tsintsiper, Isabel, et al.
Published: (2026)
Large Language Models with Temporal Reasoning for Longitudinal Clinical Summarization and Prediction
by: Kruse, Maya, et al.
Published: (2025)
by: Kruse, Maya, et al.
Published: (2025)
NOWJ@COLIEE 2025: A Multi-stage Framework Integrating Embedding Models and Large Language Models for Legal Retrieval and Entailment
by: Nguyen, Hoang-Trung, et al.
Published: (2025)
by: Nguyen, Hoang-Trung, et al.
Published: (2025)
ClinicalAgent: Clinical Trial Multi-Agent System with Large Language Model-based Reasoning
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
Assessing Adversarial Robustness of Large Language Models: An Empirical Study
by: Yang, Zeyu, et al.
Published: (2024)
by: Yang, Zeyu, et al.
Published: (2024)
Distilling Reasoning Ability from Large Language Models with Adaptive Thinking
by: Chen, Xiaoshu, et al.
Published: (2024)
by: Chen, Xiaoshu, et al.
Published: (2024)
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
by: Cohn, Anthony G, et al.
Published: (2024)
by: Cohn, Anthony G, et al.
Published: (2024)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
by: Li, Xin, et al.
Published: (2025)
by: Li, Xin, et al.
Published: (2025)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
by: Hou, Guanyu, et al.
Published: (2025)
by: Hou, Guanyu, et al.
Published: (2025)
The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
by: Nguyen, Phuc Minh, et al.
Published: (2025)
by: Nguyen, Phuc Minh, et al.
Published: (2025)
Pre-Calc: Learning to Use the Calculator Improves Numeracy in Language Models
by: Veerendranath, Vishruth, et al.
Published: (2024)
by: Veerendranath, Vishruth, et al.
Published: (2024)
Exploiting LLMs' Reasoning Capability to Infer Implicit Concepts in Legal Information Retrieval
by: Nguyen, Hai-Long, et al.
Published: (2024)
by: Nguyen, Hai-Long, et al.
Published: (2024)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
by: Zhan, Xiaoyu, et al.
Published: (2025)
by: Zhan, Xiaoyu, et al.
Published: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
by: Wang, Yajing, et al.
Published: (2024)
by: Wang, Yajing, et al.
Published: (2024)
Improving Interactive Diagnostic Ability of a Large Language Model Agent Through Clinical Experience Learning
by: Sun, Zhoujian, et al.
Published: (2025)
by: Sun, Zhoujian, et al.
Published: (2025)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
by: Zhou, Jie, et al.
Published: (2025)
by: Zhou, Jie, et al.
Published: (2025)
Evaluating the Symbol Binding Ability of Large Language Models for Multiple-Choice Questions in Vietnamese General Education
by: Nguyen, Duc-Vu, et al.
Published: (2023)
by: Nguyen, Duc-Vu, et al.
Published: (2023)
The Effect of Scripts and Formats on LLM Numeracy
by: Reddy, Varshini, et al.
Published: (2026)
by: Reddy, Varshini, et al.
Published: (2026)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
by: WU, Jiageng, et al.
Published: (2024)
by: WU, Jiageng, et al.
Published: (2024)
An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
by: Li, Zongjie, et al.
Published: (2024)
by: Li, Zongjie, et al.
Published: (2024)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
by: Chen, Zui, et al.
Published: (2024)
by: Chen, Zui, et al.
Published: (2024)
Similar Items
-
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
by: Li, Haoyang, et al.
Published: (2025) -
Principles from Clinical Research for NLP Model Generalization
by: Elangovan, Aparna, et al.
Published: (2023) -
Direct Evaluation of Chain-of-Thought in Multi-hop Reasoning with Knowledge Graphs
by: Nguyen, Minh-Vuong, et al.
Published: (2024) -
EMBRE: Entity-aware Masking for Biomedical Relation Extraction
by: Li, Mingjie, et al.
Published: (2024) -
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
by: Do, Quyet V., et al.
Published: (2026)