Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Nasr-Esfahani, Ali, Bekrani, Mehdi, Rajabi, Roozbeh
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866912227936698368
author Nasr-Esfahani, Ali
Bekrani, Mehdi
Rajabi, Roozbeh
author_facet Nasr-Esfahani, Ali
Bekrani, Mehdi
Rajabi, Roozbeh
contents Artificial intelligence (AI) has significantly advanced speech recognition applications. However, many existing neural network-based methods struggle with noise, reducing accuracy in real-world environments. This study addresses isolated spoken Persian digit recognition (zero to nine) under noisy conditions, particularly for phonetically similar numbers. A hybrid model combining residual convolutional neural networks and bidirectional gated recurrent units (BiGRU) is proposed, utilizing word units instead of phoneme units for speaker-independent recognition. The FARSDIGIT1 dataset, augmented with various approaches, is processed using Mel-Frequency Cepstral Coefficients (MFCC) for feature extraction. Experimental results demonstrate the model's effectiveness, achieving 98.53%, 96.10%, and 95.92% accuracy on training, validation, and test sets, respectively. In noisy conditions, the proposed approach improves recognition by 26.88% over phoneme unit-based LSTM models and surpasses the Mel-scale Two Dimension Root Cepstrum Coefficients (MTDRCC) feature extraction technique along with MLP model (MTDRCC+MLP) by 7.61%.
format Preprint
id arxiv_https___arxiv_org_abs_2412_10857
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model
Nasr-Esfahani, Ali
Bekrani, Mehdi
Rajabi, Roozbeh
Sound
Computer Vision and Pattern Recognition
Audio and Speech Processing
Artificial intelligence (AI) has significantly advanced speech recognition applications. However, many existing neural network-based methods struggle with noise, reducing accuracy in real-world environments. This study addresses isolated spoken Persian digit recognition (zero to nine) under noisy conditions, particularly for phonetically similar numbers. A hybrid model combining residual convolutional neural networks and bidirectional gated recurrent units (BiGRU) is proposed, utilizing word units instead of phoneme units for speaker-independent recognition. The FARSDIGIT1 dataset, augmented with various approaches, is processed using Mel-Frequency Cepstral Coefficients (MFCC) for feature extraction. Experimental results demonstrate the model's effectiveness, achieving 98.53%, 96.10%, and 95.92% accuracy on training, validation, and test sets, respectively. In noisy conditions, the proposed approach improves recognition by 26.88% over phoneme unit-based LSTM models and surpasses the Mel-scale Two Dimension Root Cepstrum Coefficients (MTDRCC) feature extraction technique along with MLP model (MTDRCC+MLP) by 7.61%.
title Robust Persian Digit Recognition in Noisy Environments Using Hybrid CNN-BiGRU Model
topic Sound
Computer Vision and Pattern Recognition
Audio and Speech Processing
url https://arxiv.org/abs/2412.10857