Beyond Random Missingness: Clinically Rethinking for Healthcare Time Series Imputation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Qian, Linglong, Yang, Yiyuan, Du, Wenjie, Wang, Jun, Dobsoni, Richard, Ibrahim, Zina
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866917910707961856
author Qian, Linglong
Yang, Yiyuan
Du, Wenjie
Wang, Jun
Dobsoni, Richard
Ibrahim, Zina
author_facet Qian, Linglong
Yang, Yiyuan
Du, Wenjie
Wang, Jun
Dobsoni, Richard
Ibrahim, Zina
contents This study investigates the impact of masking strategies on time series imputation models in healthcare settings. While current approaches predominantly rely on random masking for model evaluation, this practice fails to capture the structured nature of missing patterns in clinical data. Using the PhysioNet Challenge 2012 dataset, we analyse how different masking implementations affect both imputation accuracy and downstream clinical predictions across eleven imputation methods. Our results demonstrate that masking choices significantly influence model performance, while recurrent architectures show more consistent performance across strategies. Analysis of downstream mortality prediction reveals that imputation accuracy doesn't necessarily translate to optimal clinical prediction capabilities. Our findings emphasise the need for clinically-informed masking strategies that better reflect real-world missing patterns in healthcare data, suggesting current evaluation frameworks may need reconsideration for reliable clinical deployment.
format Preprint
id arxiv_https___arxiv_org_abs_2405_17508
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Beyond Random Missingness: Clinically Rethinking for Healthcare Time Series Imputation
Qian, Linglong
Yang, Yiyuan
Du, Wenjie
Wang, Jun
Dobsoni, Richard
Ibrahim, Zina
Machine Learning
This study investigates the impact of masking strategies on time series imputation models in healthcare settings. While current approaches predominantly rely on random masking for model evaluation, this practice fails to capture the structured nature of missing patterns in clinical data. Using the PhysioNet Challenge 2012 dataset, we analyse how different masking implementations affect both imputation accuracy and downstream clinical predictions across eleven imputation methods. Our results demonstrate that masking choices significantly influence model performance, while recurrent architectures show more consistent performance across strategies. Analysis of downstream mortality prediction reveals that imputation accuracy doesn't necessarily translate to optimal clinical prediction capabilities. Our findings emphasise the need for clinically-informed masking strategies that better reflect real-world missing patterns in healthcare data, suggesting current evaluation frameworks may need reconsideration for reliable clinical deployment.
title Beyond Random Missingness: Clinically Rethinking for Healthcare Time Series Imputation
topic Machine Learning
url https://arxiv.org/abs/2405.17508