Sequential Editing for Lifelong Training of Speech Recognition Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Kulshreshtha, Devang, Dingliwal, Saket, Houston, Brady, Pappas, Nikolaos, Ronanki, Srikanth
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866916409303367680
author Kulshreshtha, Devang
Dingliwal, Saket
Houston, Brady
Pappas, Nikolaos
Ronanki, Srikanth
author_facet Kulshreshtha, Devang
Dingliwal, Saket
Houston, Brady
Pappas, Nikolaos
Ronanki, Srikanth
contents Automatic Speech Recognition (ASR) traditionally assumes known domains, but adding data from a new domain raises concerns about computational inefficiencies linked to retraining models on both existing and new domains. Fine-tuning solely on new domain risks Catastrophic Forgetting (CF). To address this, Lifelong Learning (LLL) algorithms have been proposed for ASR. Prior research has explored techniques such as Elastic Weight Consolidation, Knowledge Distillation, and Replay, all of which necessitate either additional parameters or access to prior domain data. We propose Sequential Model Editing as a novel method to continually learn new domains in ASR systems. Different than previous methods, our approach does not necessitate access to prior datasets or the introduction of extra parameters. Our study demonstrates up to 15% Word Error Rate Reduction (WERR) over fine-tuning baseline, and superior efficiency over other LLL techniques on CommonVoice English multi-accent dataset.
format Preprint
id arxiv_https___arxiv_org_abs_2406_17935
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Sequential Editing for Lifelong Training of Speech Recognition Models
Kulshreshtha, Devang
Dingliwal, Saket
Houston, Brady
Pappas, Nikolaos
Ronanki, Srikanth
Computation and Language
Sound
Audio and Speech Processing
Automatic Speech Recognition (ASR) traditionally assumes known domains, but adding data from a new domain raises concerns about computational inefficiencies linked to retraining models on both existing and new domains. Fine-tuning solely on new domain risks Catastrophic Forgetting (CF). To address this, Lifelong Learning (LLL) algorithms have been proposed for ASR. Prior research has explored techniques such as Elastic Weight Consolidation, Knowledge Distillation, and Replay, all of which necessitate either additional parameters or access to prior domain data. We propose Sequential Model Editing as a novel method to continually learn new domains in ASR systems. Different than previous methods, our approach does not necessitate access to prior datasets or the introduction of extra parameters. Our study demonstrates up to 15% Word Error Rate Reduction (WERR) over fine-tuning baseline, and superior efficiency over other LLL techniques on CommonVoice English multi-accent dataset.
title Sequential Editing for Lifelong Training of Speech Recognition Models
topic Computation and Language
Sound
Audio and Speech Processing
url https://arxiv.org/abs/2406.17935