Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding
Fuente:
arXiv
Salvato in:
| Autori principali: | , , , , |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
| _version_ | 1866912552164786176 |
|---|---|
| author | Yin, Congchi Yu, Qian Fang, Zhiwei Peng, Changping Li, Piji |
| author_facet | Yin, Congchi Yu, Qian Fang, Zhiwei Peng, Changping Li, Piji |
| contents | Recent major milestones have successfully reconstructed natural language from non-invasive brain signals (e.g. functional Magnetic Resonance Imaging (fMRI) and Electroencephalogram (EEG)) across subjects. However, we find current dataset splitting strategies for cross-subject brain-to-text decoding are wrong. Specifically, we first demonstrate that all current splitting methods suffer from data leakage problem, which refers to the leakage of validation and test data into training set, resulting in significant overfitting and overestimation of decoding models. In this study, we develop a right cross-subject data splitting criterion without data leakage for decoding fMRI and EEG signal to text. Some SOTA brain-to-text decoding models are re-evaluated correctly with the proposed criterion for further research. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2312_10987 |
| institution | arXiv |
| publishDate | 2023 |
| record_format | arxiv |
| spellingShingle | Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding Yin, Congchi Yu, Qian Fang, Zhiwei Peng, Changping Li, Piji Computation and Language Recent major milestones have successfully reconstructed natural language from non-invasive brain signals (e.g. functional Magnetic Resonance Imaging (fMRI) and Electroencephalogram (EEG)) across subjects. However, we find current dataset splitting strategies for cross-subject brain-to-text decoding are wrong. Specifically, we first demonstrate that all current splitting methods suffer from data leakage problem, which refers to the leakage of validation and test data into training set, resulting in significant overfitting and overestimation of decoding models. In this study, we develop a right cross-subject data splitting criterion without data leakage for decoding fMRI and EEG signal to text. Some SOTA brain-to-text decoding models are re-evaluated correctly with the proposed criterion for further research. |
| title | Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding |
| topic | Computation and Language |
| url | https://arxiv.org/abs/2312.10987 |