Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yin, Congchi, Yu, Qian, Fang, Zhiwei, Peng, Changping, Li, Piji
Natura: Preprint
Pubblicazione: 2023
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866912552164786176
author Yin, Congchi
Yu, Qian
Fang, Zhiwei
Peng, Changping
Li, Piji
author_facet Yin, Congchi
Yu, Qian
Fang, Zhiwei
Peng, Changping
Li, Piji
contents Recent major milestones have successfully reconstructed natural language from non-invasive brain signals (e.g. functional Magnetic Resonance Imaging (fMRI) and Electroencephalogram (EEG)) across subjects. However, we find current dataset splitting strategies for cross-subject brain-to-text decoding are wrong. Specifically, we first demonstrate that all current splitting methods suffer from data leakage problem, which refers to the leakage of validation and test data into training set, resulting in significant overfitting and overestimation of decoding models. In this study, we develop a right cross-subject data splitting criterion without data leakage for decoding fMRI and EEG signal to text. Some SOTA brain-to-text decoding models are re-evaluated correctly with the proposed criterion for further research.
format Preprint
id arxiv_https___arxiv_org_abs_2312_10987
institution arXiv
publishDate 2023
record_format arxiv
spellingShingle Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding
Yin, Congchi
Yu, Qian
Fang, Zhiwei
Peng, Changping
Li, Piji
Computation and Language
Recent major milestones have successfully reconstructed natural language from non-invasive brain signals (e.g. functional Magnetic Resonance Imaging (fMRI) and Electroencephalogram (EEG)) across subjects. However, we find current dataset splitting strategies for cross-subject brain-to-text decoding are wrong. Specifically, we first demonstrate that all current splitting methods suffer from data leakage problem, which refers to the leakage of validation and test data into training set, resulting in significant overfitting and overestimation of decoding models. In this study, we develop a right cross-subject data splitting criterion without data leakage for decoding fMRI and EEG signal to text. Some SOTA brain-to-text decoding models are re-evaluated correctly with the proposed criterion for further research.
title Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding
topic Computation and Language
url https://arxiv.org/abs/2312.10987