Mitigating Data Imbalance in Automated Speaking Assessment

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Tsai, Fong-Chun, Huang, Kuan-Tang, Yan, Bi-Cheng, Lo, Tien-Hong, Chen, Berlin
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866908778009460736
author Tsai, Fong-Chun
Huang, Kuan-Tang
Yan, Bi-Cheng
Lo, Tien-Hong
Chen, Berlin
author_facet Tsai, Fong-Chun
Huang, Kuan-Tang
Yan, Bi-Cheng
Lo, Tien-Hong
Chen, Berlin
contents Automated Speaking Assessment (ASA) plays a crucial role in evaluating second-language (L2) learners proficiency. However, ASA models often suffer from class imbalance, leading to biased predictions. To address this, we introduce a novel objective for training ASA models, dubbed the Balancing Logit Variation (BLV) loss, which perturbs model predictions to improve feature representation for minority classes without modifying the dataset. Evaluations on the ICNALE benchmark dataset show that integrating the BLV loss into a celebrated text-based (BERT) model significantly enhances classification accuracy and fairness, making automated speech evaluation more robust for diverse learners.
format Preprint
id arxiv_https___arxiv_org_abs_2509_03010
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Mitigating Data Imbalance in Automated Speaking Assessment
Tsai, Fong-Chun
Huang, Kuan-Tang
Yan, Bi-Cheng
Lo, Tien-Hong
Chen, Berlin
Computation and Language
Machine Learning
Audio and Speech Processing
Automated Speaking Assessment (ASA) plays a crucial role in evaluating second-language (L2) learners proficiency. However, ASA models often suffer from class imbalance, leading to biased predictions. To address this, we introduce a novel objective for training ASA models, dubbed the Balancing Logit Variation (BLV) loss, which perturbs model predictions to improve feature representation for minority classes without modifying the dataset. Evaluations on the ICNALE benchmark dataset show that integrating the BLV loss into a celebrated text-based (BERT) model significantly enhances classification accuracy and fairness, making automated speech evaluation more robust for diverse learners.
title Mitigating Data Imbalance in Automated Speaking Assessment
topic Computation and Language
Machine Learning
Audio and Speech Processing
url https://arxiv.org/abs/2509.03010