MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Congbo, Zhang, Yichun, Al-Jazzazi, Yousef, Foisal, Ahamed, Sharma, Laasya, Sadqi, Yousra, Saleh, Khaled, Mallat, Jihad, Shamout, Farah E. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
by: Abu-Daoud, Mouath, et al.
Published: (2026)
by: Abu-Daoud, Mouath, et al.
Published: (2026)
MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data
by: Jorf, Baraa Al, et al.
Published: (2025)
by: Jorf, Baraa Al, et al.
Published: (2025)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
by: Abouzahir, Chaimae, et al.
Published: (2026)
by: Abouzahir, Chaimae, et al.
Published: (2026)
VariErr NLI: Separating Annotation Error from Human Label Variation
by: Weber-Genzel, Leon, et al.
Published: (2024)
by: Weber-Genzel, Leon, et al.
Published: (2024)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
by: Kyung, Sunggu, et al.
Published: (2025)
by: Kyung, Sunggu, et al.
Published: (2025)
To Err Is Human; To Annotate, SILICON? Toward Robust Reproducibility in LLM Annotation
by: Cheng, Xiang, et al.
Published: (2024)
by: Cheng, Xiang, et al.
Published: (2024)
Uncertainty Quantification for Machine Learning in Healthcare: A Survey
by: López, L. Julián Lechuga, et al.
Published: (2025)
by: López, L. Julián Lechuga, et al.
Published: (2025)
MILES: Modality-Informed Learning Rate Scheduler for Balancing Multimodal Learning
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
MIND: Modality-Informed Knowledge Distillation Framework for Multimodal Clinical Prediction Tasks
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks
by: Jorf, Baraa Al, et al.
Published: (2026)
by: Jorf, Baraa Al, et al.
Published: (2026)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
by: Daoud, Mouath Abu, et al.
Published: (2025)
by: Daoud, Mouath Abu, et al.
Published: (2025)
RPG-AE: Neuro-Symbolic Graph Autoencoders with Rare Pattern Mining for Provenance-Based Anomaly Detection
by: Tauhid, Asif, et al.
Published: (2026)
by: Tauhid, Asif, et al.
Published: (2026)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
by: Xu, Yifan, et al.
Published: (2024)
by: Xu, Yifan, et al.
Published: (2024)
To Err is Robotic: Rapid Value-Based Trial-and-Error during Deployment
by: Du, Maximilian, et al.
Published: (2024)
by: Du, Maximilian, et al.
Published: (2024)
MetaErr: Towards Predicting Error Patterns in Deep Neural Networks
by: Totakura, Varun, et al.
Published: (2026)
by: Totakura, Varun, et al.
Published: (2026)
TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech
by: Venturini, Shamira, et al.
Published: (2026)
by: Venturini, Shamira, et al.
Published: (2026)
Multi-modal Masked Siamese Network Improves Chest X-Ray Representation Learning
by: Shurrab, Saeed, et al.
Published: (2024)
by: Shurrab, Saeed, et al.
Published: (2024)
Distance Adaptive Beam Search for Provably Accurate Graph-Based Nearest Neighbor Search
by: Al-Jazzazi, Yousef, et al.
Published: (2025)
by: Al-Jazzazi, Yousef, et al.
Published: (2025)
ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics
by: Fu, Weiping, et al.
Published: (2026)
by: Fu, Weiping, et al.
Published: (2026)
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
by: Bianchi, Federico, et al.
Published: (2025)
by: Bianchi, Federico, et al.
Published: (2025)
The Role of Functional Muscle Networks in Improving Hand Gesture Perception for Human-Machine Interfaces
by: Armanini, Costanza, et al.
Published: (2024)
by: Armanini, Costanza, et al.
Published: (2024)
Gesturing Refugees: Participation, Affect, then Action?
by: Farah Saleh
Published: (2021)
by: Farah Saleh
Published: (2021)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
by: Qiao, Chuhan, et al.
Published: (2026)
by: Qiao, Chuhan, et al.
Published: (2026)
Towards a cleaner and sustainable Europe and Central Asia : An investigation of the logistics‐environment nexus
by: Mohamed Dawood Shamout
Published: (2024)
by: Mohamed Dawood Shamout
Published: (2024)
The role of supply chain analytics on supply chain responsiveness, resilience, and restoration (3Rs) capabilities in the United Arab Emirates
by: Mohamed Dawood Shamout
Published: (2024)
by: Mohamed Dawood Shamout
Published: (2024)
How PC-based Methods Err: Towards Better Reporting of Assumption Violations and Small Sample Errors
by: Faltenbacher, Sofia, et al.
Published: (2025)
by: Faltenbacher, Sofia, et al.
Published: (2025)
To Err Is Human, but Llamas Can Learn It Too
by: Luhtaru, Agnes, et al.
Published: (2024)
by: Luhtaru, Agnes, et al.
Published: (2024)
Seismic performance of concrete tunnel–sand–pile interaction by the shake table test
by: Md. Foisal Haque, et al.
Published: (2024)
by: Md. Foisal Haque, et al.
Published: (2024)
Analytical formulations of tunnel–soil–pile interaction under seismic excitations
by: Md. Foisal Haque, et al.
Published: (2024)
by: Md. Foisal Haque, et al.
Published: (2024)
Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data
by: López, L. Julián Lechuga, et al.
Published: (2026)
by: López, L. Julián Lechuga, et al.
Published: (2026)
BlendFL: Blended Federated Learning for Handling Multimodal Data Heterogeneity
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
by: Guerra-Manzanares, Alejandro, et al.
Published: (2025)
EHR-RAGp: Retrieval-Augmented Prototype-Guided Foundation Model for Electronic Health Records
by: Shurrab, Saeed, et al.
Published: (2026)
by: Shurrab, Saeed, et al.
Published: (2026)
Freedom: A Critical Study in The Outsider by Richard Wright
by: Khaled Saleh Ahmed
Published: (2018)
by: Khaled Saleh Ahmed
Published: (2018)
CONSTRUCCIONES DE MADERA COMPUESTAS PARA CERRAMIENTOS AUTOPORTANTES
by: Khaled Saleh Pascha
Published: (2013)
by: Khaled Saleh Pascha
Published: (2013)
To Err is Machine: Vulnerability Detection Challenges LLM Reasoning
by: Steenhoek, Benjamin, et al.
Published: (2024)
by: Steenhoek, Benjamin, et al.
Published: (2024)
Err on the Side of Texture: Texture Bias on Real Data
by: Hoak, Blaine, et al.
Published: (2024)
by: Hoak, Blaine, et al.
Published: (2024)
MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision
by: Wu, Yuyang, et al.
Published: (2025)
by: Wu, Yuyang, et al.
Published: (2025)
Hierarchic Flows to Estimate and Sample High-dimensional Probabilities
by: Lempereur, Etienne, et al.
Published: (2024)
by: Lempereur, Etienne, et al.
Published: (2024)
Privacy-preserving machine learning for healthcare: open challenges and future perspectives
by: Guerra-Manzanares, Alejandro, et al.
Published: (2023)
by: Guerra-Manzanares, Alejandro, et al.
Published: (2023)
Similar Items
-
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
by: Abu-Daoud, Mouath, et al.
Published: (2026) -
MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data
by: Jorf, Baraa Al, et al.
Published: (2025) -
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
by: Abouzahir, Chaimae, et al.
Published: (2026) -
VariErr NLI: Separating Annotation Error from Human Label Variation
by: Weber-Genzel, Leon, et al.
Published: (2024) -
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
by: Kyung, Sunggu, et al.
Published: (2025)