MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Congbo, Zhang, Yichun, Al-Jazzazi, Yousef, Foisal, Ahamed, Sharma, Laasya, Sadqi, Yousra, Saleh, Khaled, Mallat, Jihad, Shamout, Farah E. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
par: Abu-Daoud, Mouath, et autres
Publié: (2026)
par: Abu-Daoud, Mouath, et autres
Publié: (2026)
MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data
par: Jorf, Baraa Al, et autres
Publié: (2025)
par: Jorf, Baraa Al, et autres
Publié: (2025)
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
par: Abouzahir, Chaimae, et autres
Publié: (2026)
par: Abouzahir, Chaimae, et autres
Publié: (2026)
VariErr NLI: Separating Annotation Error from Human Label Variation
par: Weber-Genzel, Leon, et autres
Publié: (2024)
par: Weber-Genzel, Leon, et autres
Publié: (2024)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
par: Kyung, Sunggu, et autres
Publié: (2025)
par: Kyung, Sunggu, et autres
Publié: (2025)
To Err Is Human; To Annotate, SILICON? Toward Robust Reproducibility in LLM Annotation
par: Cheng, Xiang, et autres
Publié: (2024)
par: Cheng, Xiang, et autres
Publié: (2024)
Uncertainty Quantification for Machine Learning in Healthcare: A Survey
par: López, L. Julián Lechuga, et autres
Publié: (2025)
par: López, L. Julián Lechuga, et autres
Publié: (2025)
MILES: Modality-Informed Learning Rate Scheduler for Balancing Multimodal Learning
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
MIND: Modality-Informed Knowledge Distillation Framework for Multimodal Clinical Prediction Tasks
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks
par: Jorf, Baraa Al, et autres
Publié: (2026)
par: Jorf, Baraa Al, et autres
Publié: (2026)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
par: Daoud, Mouath Abu, et autres
Publié: (2025)
par: Daoud, Mouath Abu, et autres
Publié: (2025)
RPG-AE: Neuro-Symbolic Graph Autoencoders with Rare Pattern Mining for Provenance-Based Anomaly Detection
par: Tauhid, Asif, et autres
Publié: (2026)
par: Tauhid, Asif, et autres
Publié: (2026)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
par: Xu, Yifan, et autres
Publié: (2024)
par: Xu, Yifan, et autres
Publié: (2024)
To Err is Robotic: Rapid Value-Based Trial-and-Error during Deployment
par: Du, Maximilian, et autres
Publié: (2024)
par: Du, Maximilian, et autres
Publié: (2024)
MetaErr: Towards Predicting Error Patterns in Deep Neural Networks
par: Totakura, Varun, et autres
Publié: (2026)
par: Totakura, Varun, et autres
Publié: (2026)
TalkTag: Fine-Grained Morphosyntactic Error Annotation for Transcribed Speech
par: Venturini, Shamira, et autres
Publié: (2026)
par: Venturini, Shamira, et autres
Publié: (2026)
Multi-modal Masked Siamese Network Improves Chest X-Ray Representation Learning
par: Shurrab, Saeed, et autres
Publié: (2024)
par: Shurrab, Saeed, et autres
Publié: (2024)
Distance Adaptive Beam Search for Provably Accurate Graph-Based Nearest Neighbor Search
par: Al-Jazzazi, Yousef, et autres
Publié: (2025)
par: Al-Jazzazi, Yousef, et autres
Publié: (2025)
ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics
par: Fu, Weiping, et autres
Publié: (2026)
par: Fu, Weiping, et autres
Publié: (2026)
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
par: Bianchi, Federico, et autres
Publié: (2025)
par: Bianchi, Federico, et autres
Publié: (2025)
The Role of Functional Muscle Networks in Improving Hand Gesture Perception for Human-Machine Interfaces
par: Armanini, Costanza, et autres
Publié: (2024)
par: Armanini, Costanza, et autres
Publié: (2024)
Gesturing Refugees: Participation, Affect, then Action?
par: Farah Saleh
Publié: (2021)
par: Farah Saleh
Publié: (2021)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
par: Qiao, Chuhan, et autres
Publié: (2026)
par: Qiao, Chuhan, et autres
Publié: (2026)
Towards a cleaner and sustainable Europe and Central Asia : An investigation of the logistics‐environment nexus
par: Mohamed Dawood Shamout
Publié: (2024)
par: Mohamed Dawood Shamout
Publié: (2024)
The role of supply chain analytics on supply chain responsiveness, resilience, and restoration (3Rs) capabilities in the United Arab Emirates
par: Mohamed Dawood Shamout
Publié: (2024)
par: Mohamed Dawood Shamout
Publié: (2024)
How PC-based Methods Err: Towards Better Reporting of Assumption Violations and Small Sample Errors
par: Faltenbacher, Sofia, et autres
Publié: (2025)
par: Faltenbacher, Sofia, et autres
Publié: (2025)
To Err Is Human, but Llamas Can Learn It Too
par: Luhtaru, Agnes, et autres
Publié: (2024)
par: Luhtaru, Agnes, et autres
Publié: (2024)
Seismic performance of concrete tunnel–sand–pile interaction by the shake table test
par: Md. Foisal Haque, et autres
Publié: (2024)
par: Md. Foisal Haque, et autres
Publié: (2024)
Analytical formulations of tunnel–soil–pile interaction under seismic excitations
par: Md. Foisal Haque, et autres
Publié: (2024)
par: Md. Foisal Haque, et autres
Publié: (2024)
Data-Driven Priors for Uncertainty-Aware Deterioration Risk Prediction with Multimodal Data
par: López, L. Julián Lechuga, et autres
Publié: (2026)
par: López, L. Julián Lechuga, et autres
Publié: (2026)
BlendFL: Blended Federated Learning for Handling Multimodal Data Heterogeneity
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2025)
EHR-RAGp: Retrieval-Augmented Prototype-Guided Foundation Model for Electronic Health Records
par: Shurrab, Saeed, et autres
Publié: (2026)
par: Shurrab, Saeed, et autres
Publié: (2026)
Freedom: A Critical Study in The Outsider by Richard Wright
par: Khaled Saleh Ahmed
Publié: (2018)
par: Khaled Saleh Ahmed
Publié: (2018)
CONSTRUCCIONES DE MADERA COMPUESTAS PARA CERRAMIENTOS AUTOPORTANTES
par: Khaled Saleh Pascha
Publié: (2013)
par: Khaled Saleh Pascha
Publié: (2013)
To Err is Machine: Vulnerability Detection Challenges LLM Reasoning
par: Steenhoek, Benjamin, et autres
Publié: (2024)
par: Steenhoek, Benjamin, et autres
Publié: (2024)
Err on the Side of Texture: Texture Bias on Real Data
par: Hoak, Blaine, et autres
Publié: (2024)
par: Hoak, Blaine, et autres
Publié: (2024)
MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
par: Liu, Jiyao, et autres
Publié: (2026)
par: Liu, Jiyao, et autres
Publié: (2026)
MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision
par: Wu, Yuyang, et autres
Publié: (2025)
par: Wu, Yuyang, et autres
Publié: (2025)
Hierarchic Flows to Estimate and Sample High-dimensional Probabilities
par: Lempereur, Etienne, et autres
Publié: (2024)
par: Lempereur, Etienne, et autres
Publié: (2024)
Privacy-preserving machine learning for healthcare: open challenges and future perspectives
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2023)
par: Guerra-Manzanares, Alejandro, et autres
Publié: (2023)
Documents similaires
-
MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark
par: Abu-Daoud, Mouath, et autres
Publié: (2026) -
MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data
par: Jorf, Baraa Al, et autres
Publié: (2025) -
Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks
par: Abouzahir, Chaimae, et autres
Publié: (2026) -
VariErr NLI: Separating Annotation Error from Human Label Variation
par: Weber-Genzel, Leon, et autres
Publié: (2024) -
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
par: Kyung, Sunggu, et autres
Publié: (2025)