MVP: Multi-source Voice Pathology detection

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Koudounas, Alkis, La Quatra, Moreno, Ciravegna, Gabriele, Fantini, Marco, Crosetti, Erika, Succo, Giovanni, Cerquitelli, Tania, Siniscalchi, Sabato Marco, Baralis, Elena
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866913859642589184
author Koudounas, Alkis
La Quatra, Moreno
Ciravegna, Gabriele
Fantini, Marco
Crosetti, Erika
Succo, Giovanni
Cerquitelli, Tania
Siniscalchi, Sabato Marco
Baralis, Elena
author_facet Koudounas, Alkis
La Quatra, Moreno
Ciravegna, Gabriele
Fantini, Marco
Crosetti, Erika
Succo, Giovanni
Cerquitelli, Tania
Siniscalchi, Sabato Marco
Baralis, Elena
contents Voice disorders significantly impact patient quality of life, yet non-invasive automated diagnosis remains under-explored due to both the scarcity of pathological voice data, and the variability in recording sources. This work introduces MVP (Multi-source Voice Pathology detection), a novel approach that leverages transformers operating directly on raw voice signals. We explore three fusion strategies to combine sentence reading and sustained vowel recordings: waveform concatenation, intermediate feature fusion, and decision-level combination. Empirical validation across the German, Portuguese, and Italian languages shows that intermediate feature fusion using transformers best captures the complementary characteristics of both recording types. Our approach achieves up to +13% AUC improvement over single-source methods.
format Preprint
id arxiv_https___arxiv_org_abs_2505_20050
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle MVP: Multi-source Voice Pathology detection
Koudounas, Alkis
La Quatra, Moreno
Ciravegna, Gabriele
Fantini, Marco
Crosetti, Erika
Succo, Giovanni
Cerquitelli, Tania
Siniscalchi, Sabato Marco
Baralis, Elena
Audio and Speech Processing
Computation and Language
Voice disorders significantly impact patient quality of life, yet non-invasive automated diagnosis remains under-explored due to both the scarcity of pathological voice data, and the variability in recording sources. This work introduces MVP (Multi-source Voice Pathology detection), a novel approach that leverages transformers operating directly on raw voice signals. We explore three fusion strategies to combine sentence reading and sustained vowel recordings: waveform concatenation, intermediate feature fusion, and decision-level combination. Empirical validation across the German, Portuguese, and Italian languages shows that intermediate feature fusion using transformers best captures the complementary characteristics of both recording types. Our approach achieves up to +13% AUC improvement over single-source methods.
title MVP: Multi-source Voice Pathology detection
topic Audio and Speech Processing
Computation and Language
url https://arxiv.org/abs/2505.20050