Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | AlDahoul, Nouar, Zaki, Yasir |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking the Legal Reasoning of LLMs in Arabic Islamic Inheritance Cases
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
Detecting Hope, Hate, and Emotion in Arabic Textual Speech and Multi-modal Memes Using Large Language Models
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
A Novel BERT-based Classifier to Detect Political Leaning of YouTube Videos based on their Titles
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
by: Jan, Essa, et al.
Published: (2024)
by: Jan, Essa, et al.
Published: (2024)
AI-generated faces influence gender stereotypes and racial homogenization
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
Toward a Safer Web: Multilingual Multi-Agent LLMs for Mitigating Adversarial Misinformation Attacks
by: Aldahoul, Nouar, et al.
Published: (2025)
by: Aldahoul, Nouar, et al.
Published: (2025)
Advancing Content Moderation: Evaluating Large Language Models for Detecting Sensitive Content Across Text, Images, and Videos
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
Self-Reflection Makes Large Language Models Safer, Less Biased, and Ideologically Neutral
by: Liu, Fengyuan, et al.
Published: (2024)
by: Liu, Fengyuan, et al.
Published: (2024)
Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images
by: Sien, Chan Hao, et al.
Published: (2026)
by: Sien, Chan Hao, et al.
Published: (2026)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
by: Malghan, Arjun R.
Published: (2025)
by: Malghan, Arjun R.
Published: (2025)
Neutralizing the Narrative: AI-Powered Debiasing of Online News Articles
by: Kuo, Chen Wei, et al.
Published: (2025)
by: Kuo, Chen Wei, et al.
Published: (2025)
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models
by: Zbeeb, Mohammad, et al.
Published: (2025)
by: Zbeeb, Mohammad, et al.
Published: (2025)
SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning
by: Elbadry, Rania, et al.
Published: (2026)
by: Elbadry, Rania, et al.
Published: (2026)
Real-Time Human Detection for Aerial Captured Video Sequences via Deep Models
by: AlDahoul, Nouar, et al.
Published: (2026)
by: AlDahoul, Nouar, et al.
Published: (2026)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
by: Daoud, Mouath Abu, et al.
Published: (2025)
by: Daoud, Mouath Abu, et al.
Published: (2025)
A Longitudinal Analysis of Racial and Gender Bias in New York Times and Fox News Images and Articles
by: Ibrahim, Hazem, et al.
Published: (2024)
by: Ibrahim, Hazem, et al.
Published: (2024)
Exploring Vision Language Models for Facial Attribute Recognition: Emotion, Race, Gender, and Age
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
ArabianGPT: Native Arabic GPT-based Large Language Model
by: Koubaa, Anis, et al.
Published: (2024)
by: Koubaa, Anis, et al.
Published: (2024)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark
by: Xing, Junjie, et al.
Published: (2025)
by: Xing, Junjie, et al.
Published: (2025)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
by: Rogoz, Ana-Cristina, et al.
Published: (2025)
by: Rogoz, Ana-Cristina, et al.
Published: (2025)
Advancing Vehicle Plate Recognition: Multitasking Visual Language Models with VehiclePaliGemma
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
by: Pandit, Shrey, et al.
Published: (2025)
by: Pandit, Shrey, et al.
Published: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
by: Komanduri, Aneesh, et al.
Published: (2025)
by: Komanduri, Aneesh, et al.
Published: (2025)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
by: Xu, Yinggan, et al.
Published: (2025)
by: Xu, Yinggan, et al.
Published: (2025)
Inclusive content reduces racial and gender biases, yet non-inclusive content dominates popular culture
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
Towards Understanding Multi-Round Large Language Model Reasoning: Approximability, Learnability and Generalizability
by: Xu, Chenhui, et al.
Published: (2025)
by: Xu, Chenhui, et al.
Published: (2025)
DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain
by: Labrak, Yanis, et al.
Published: (2024)
by: Labrak, Yanis, et al.
Published: (2024)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
by: Wang, Wentian, et al.
Published: (2024)
by: Wang, Wentian, et al.
Published: (2024)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
Data Doping or True Intelligence? Evaluating the Transferability of Injected Knowledge in LLMs
by: Jan, Essa, et al.
Published: (2025)
by: Jan, Essa, et al.
Published: (2025)
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
by: Xie, Chengxing, et al.
Published: (2024)
by: Xie, Chengxing, et al.
Published: (2024)
ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text Detection
by: Khairallah, Ali, et al.
Published: (2025)
by: Khairallah, Ali, et al.
Published: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
by: Chung, Tsz Ting, et al.
Published: (2025)
by: Chung, Tsz Ting, et al.
Published: (2025)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
by: Syed, Usman, et al.
Published: (2024)
by: Syed, Usman, et al.
Published: (2024)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
by: Düzkar, Kemal
Published: (2026)
by: Düzkar, Kemal
Published: (2026)
Evaluating Large Language Models for Health-Related Text Classification Tasks with Public Social Media Data
by: Guo, Yuting, et al.
Published: (2024)
by: Guo, Yuting, et al.
Published: (2024)
Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models
by: Nezhurina, Marianna, et al.
Published: (2024)
by: Nezhurina, Marianna, et al.
Published: (2024)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
by: Khalid, Irtaza, et al.
Published: (2025)
by: Khalid, Irtaza, et al.
Published: (2025)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
by: Rizvi, Md Imbesat Hassan, et al.
Published: (2024)
by: Rizvi, Md Imbesat Hassan, et al.
Published: (2024)
Similar Items
-
Benchmarking the Legal Reasoning of LLMs in Arabic Islamic Inheritance Cases
by: AlDahoul, Nouar, et al.
Published: (2025) -
Detecting Hope, Hate, and Emotion in Arabic Textual Speech and Multi-modal Memes Using Large Language Models
by: AlDahoul, Nouar, et al.
Published: (2025) -
A Novel BERT-based Classifier to Detect Political Leaning of YouTube Videos based on their Titles
by: AlDahoul, Nouar, et al.
Published: (2024) -
Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning
by: Jan, Essa, et al.
Published: (2024) -
AI-generated faces influence gender stereotypes and racial homogenization
by: AlDahoul, Nouar, et al.
Published: (2024)