FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Kim, Jongsuk, Yu, Jaemyung, Kwon, Minchan, Kim, Junmo
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866915339592269824
author Kim, Jongsuk
Yu, Jaemyung
Kwon, Minchan
Kim, Junmo
author_facet Kim, Jongsuk
Yu, Jaemyung
Kwon, Minchan
Kim, Junmo
contents Large-scale ASR models have achieved remarkable gains in accuracy and robustness. However, fairness issues remain largely unaddressed despite their critical importance in real-world applications. In this work, we introduce FairASR, a system that mitigates demographic bias by learning representations that are uninformative about group membership, enabling fair generalization across demographic groups. Leveraging a multi-demographic dataset, our approach employs a gradient reversal layer to suppress demographic-discriminative features while maintaining the ability to capture generalizable speech patterns through an unsupervised contrastive loss. Experimental results show that FairASR delivers competitive overall ASR performance while significantly reducing performance disparities across different demographic groups.
format Preprint
id arxiv_https___arxiv_org_abs_2506_10747
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
Kim, Jongsuk
Yu, Jaemyung
Kwon, Minchan
Kim, Junmo
Audio and Speech Processing
Large-scale ASR models have achieved remarkable gains in accuracy and robustness. However, fairness issues remain largely unaddressed despite their critical importance in real-world applications. In this work, we introduce FairASR, a system that mitigates demographic bias by learning representations that are uninformative about group membership, enabling fair generalization across demographic groups. Leveraging a multi-demographic dataset, our approach employs a gradient reversal layer to suppress demographic-discriminative features while maintaining the ability to capture generalizable speech patterns through an unsupervised contrastive loss. Experimental results show that FairASR delivers competitive overall ASR performance while significantly reducing performance disparities across different demographic groups.
title FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
topic Audio and Speech Processing
url https://arxiv.org/abs/2506.10747