Balti-Tamko 02: Continuous speech dataset for Balti ASR.

Fuente: Zenodo
Salvato in:
Dettagli Bibliografici
Autore principale: Sharif, Muhammad
Natura: Recurso digital
Lingua:Lingua balti
Pubblicazione: Zenodo 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866901537604763648
author Sharif, Muhammad
author_facet Sharif, Muhammad
contents <h3><strong>Balti Continuous Speech Dataset</strong></h3> <p><strong>Overview</strong><br>The Balti Continuous Speech Dataset comprises <strong>read speech recordings</strong> from <strong>118 native Balti speakers</strong> (balanced gender representation) collected across the valleys of Baltistan in northern Pakistan. This corpus is designed to support automatic speech recognition (ASR) research and language preservation efforts for the endangered Balti language.</p> <p><strong>Key Specifications</strong></p> <ul> <li> <p><strong>Volume</strong>: 1.4 GB</p> </li> <li> <p><strong>Duration</strong>: 4.43 hours</p> </li> <li> <p><strong>Samples</strong>: 5,074 audio files (16-bit PCM WAV format, 44.1 kHz)</p> </li> <li> <p><strong>Annotation</strong>: Parallel transcriptions in Perso-Arabic script, with ongoing expansion to include <strong>Yige (Tibetan script)</strong> to capture phonetic nuances and support cross-script ASR development.</p> </li> </ul> <p><strong>Data Structure</strong></p> <ul> <li> <p><strong>Original Split</strong>: 80% training, 20% evaluation (held-out)</p> </li> <li> <p><strong>Proposed Refinement</strong>: 80% training, 10% development (validation), 10% test</p> </li> <li> <p><strong>File Format</strong>:</p> <ul> <li> <p>Audio: <code>.wav</code> (librosa-compatible)</p> </li> <li> <p>Transcripts: <code>.tsv</code> (tab-separated) with <code>S.No</code> and <code>Balti Sentence</code> fields</p> </li> </ul> </li> </ul> <p><strong>Validation & Quality Control</strong></p> <ul> <li> <p>All utterances were <strong>verified by native Balti linguists</strong> to ensure phonetic and lexical accuracy.</p> </li> <li> <p>Sentences were designed to cover <strong>50 distinct linguistic patterns</strong>, balancing lexical diversity and ASR utility.</p> </li> </ul> <p><strong>Unique Value Proposition</strong></p> <ol> <li> <p><strong>Cultural Preservation</strong>: First open corpus to pair Perso-Arabic and Yige (Tibetan) transcriptions, bridging modern and historical Balti orthographies.</p> </li> <li> <p><strong>Research-Ready</strong>: Pre-structured for ASR pipelines (train/dev/test splits) with clear metadata.</p> </li> <li> <p><strong>Low-Resource Focus</strong>: Addresses the scarcity of publicly available Balti speech data.</p> </li> </ol> <p><strong>Potential Applications</strong></p> <ul> <li> <p>Multilingual ASR for endangered languages</p> </li> <li> <p>Cross-script speech recognition (Perso-Arabic ↔ Yige)</p> </li> <li> <p>Phonetic studies of Tibetan-origin languages</p> </li> </ul> <p><strong>Ethical Compliance</strong></p> <ul> <li> <p>Speaker consent documented for research use</p> </li> <li> <p>Anonymized metadata (no PII retained)</p> </li> </ul>
format Recurso digital
id zenodo_https___doi_org_10_5281_zenodo_15649359
institution Zenodo
language bft
publishDate 2025
publisher Zenodo
record_format zenodo
spellingShingle Balti-Tamko 02: Continuous speech dataset for Balti ASR.
Sharif, Muhammad
Balti Dataset
Continuous Balti Speech
Speech Dataset
Endangered Language
ASR
<h3><strong>Balti Continuous Speech Dataset</strong></h3> <p><strong>Overview</strong><br>The Balti Continuous Speech Dataset comprises <strong>read speech recordings</strong> from <strong>118 native Balti speakers</strong> (balanced gender representation) collected across the valleys of Baltistan in northern Pakistan. This corpus is designed to support automatic speech recognition (ASR) research and language preservation efforts for the endangered Balti language.</p> <p><strong>Key Specifications</strong></p> <ul> <li> <p><strong>Volume</strong>: 1.4 GB</p> </li> <li> <p><strong>Duration</strong>: 4.43 hours</p> </li> <li> <p><strong>Samples</strong>: 5,074 audio files (16-bit PCM WAV format, 44.1 kHz)</p> </li> <li> <p><strong>Annotation</strong>: Parallel transcriptions in Perso-Arabic script, with ongoing expansion to include <strong>Yige (Tibetan script)</strong> to capture phonetic nuances and support cross-script ASR development.</p> </li> </ul> <p><strong>Data Structure</strong></p> <ul> <li> <p><strong>Original Split</strong>: 80% training, 20% evaluation (held-out)</p> </li> <li> <p><strong>Proposed Refinement</strong>: 80% training, 10% development (validation), 10% test</p> </li> <li> <p><strong>File Format</strong>:</p> <ul> <li> <p>Audio: <code>.wav</code> (librosa-compatible)</p> </li> <li> <p>Transcripts: <code>.tsv</code> (tab-separated) with <code>S.No</code> and <code>Balti Sentence</code> fields</p> </li> </ul> </li> </ul> <p><strong>Validation & Quality Control</strong></p> <ul> <li> <p>All utterances were <strong>verified by native Balti linguists</strong> to ensure phonetic and lexical accuracy.</p> </li> <li> <p>Sentences were designed to cover <strong>50 distinct linguistic patterns</strong>, balancing lexical diversity and ASR utility.</p> </li> </ul> <p><strong>Unique Value Proposition</strong></p> <ol> <li> <p><strong>Cultural Preservation</strong>: First open corpus to pair Perso-Arabic and Yige (Tibetan) transcriptions, bridging modern and historical Balti orthographies.</p> </li> <li> <p><strong>Research-Ready</strong>: Pre-structured for ASR pipelines (train/dev/test splits) with clear metadata.</p> </li> <li> <p><strong>Low-Resource Focus</strong>: Addresses the scarcity of publicly available Balti speech data.</p> </li> </ol> <p><strong>Potential Applications</strong></p> <ul> <li> <p>Multilingual ASR for endangered languages</p> </li> <li> <p>Cross-script speech recognition (Perso-Arabic ↔ Yige)</p> </li> <li> <p>Phonetic studies of Tibetan-origin languages</p> </li> </ul> <p><strong>Ethical Compliance</strong></p> <ul> <li> <p>Speaker consent documented for research use</p> </li> <li> <p>Anonymized metadata (no PII retained)</p> </li> </ul>
title Balti-Tamko 02: Continuous speech dataset for Balti ASR.
topic Balti Dataset
Continuous Balti Speech
Speech Dataset
Endangered Language
ASR
url https://doi.org/10.5281/zenodo.15649359