Balti-Tamko 02: Continuous speech dataset for Balti ASR.
Fuente:
Zenodo
Salvato in:
| Autore principale: | |
|---|---|
| Natura: | Recurso digital |
| Lingua: | Lingua balti |
| Pubblicazione: |
Zenodo
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
| _version_ | 1866901537604763648 |
|---|---|
| author | Sharif, Muhammad |
| author_facet | Sharif, Muhammad |
| contents | <h3><strong>Balti Continuous Speech Dataset</strong></h3> <p><strong>Overview</strong><br>The Balti Continuous Speech Dataset comprises <strong>read speech recordings</strong> from <strong>118 native Balti speakers</strong> (balanced gender representation) collected across the valleys of Baltistan in northern Pakistan. This corpus is designed to support automatic speech recognition (ASR) research and language preservation efforts for the endangered Balti language.</p> <p><strong>Key Specifications</strong></p> <ul> <li> <p><strong>Volume</strong>: 1.4 GB</p> </li> <li> <p><strong>Duration</strong>: 4.43 hours</p> </li> <li> <p><strong>Samples</strong>: 5,074 audio files (16-bit PCM WAV format, 44.1 kHz)</p> </li> <li> <p><strong>Annotation</strong>: Parallel transcriptions in Perso-Arabic script, with ongoing expansion to include <strong>Yige (Tibetan script)</strong> to capture phonetic nuances and support cross-script ASR development.</p> </li> </ul> <p><strong>Data Structure</strong></p> <ul> <li> <p><strong>Original Split</strong>: 80% training, 20% evaluation (held-out)</p> </li> <li> <p><strong>Proposed Refinement</strong>: 80% training, 10% development (validation), 10% test</p> </li> <li> <p><strong>File Format</strong>:</p> <ul> <li> <p>Audio: <code>.wav</code> (librosa-compatible)</p> </li> <li> <p>Transcripts: <code>.tsv</code> (tab-separated) with <code>S.No</code> and <code>Balti Sentence</code> fields</p> </li> </ul> </li> </ul> <p><strong>Validation & Quality Control</strong></p> <ul> <li> <p>All utterances were <strong>verified by native Balti linguists</strong> to ensure phonetic and lexical accuracy.</p> </li> <li> <p>Sentences were designed to cover <strong>50 distinct linguistic patterns</strong>, balancing lexical diversity and ASR utility.</p> </li> </ul> <p><strong>Unique Value Proposition</strong></p> <ol> <li> <p><strong>Cultural Preservation</strong>: First open corpus to pair Perso-Arabic and Yige (Tibetan) transcriptions, bridging modern and historical Balti orthographies.</p> </li> <li> <p><strong>Research-Ready</strong>: Pre-structured for ASR pipelines (train/dev/test splits) with clear metadata.</p> </li> <li> <p><strong>Low-Resource Focus</strong>: Addresses the scarcity of publicly available Balti speech data.</p> </li> </ol> <p><strong>Potential Applications</strong></p> <ul> <li> <p>Multilingual ASR for endangered languages</p> </li> <li> <p>Cross-script speech recognition (Perso-Arabic ↔ Yige)</p> </li> <li> <p>Phonetic studies of Tibetan-origin languages</p> </li> </ul> <p><strong>Ethical Compliance</strong></p> <ul> <li> <p>Speaker consent documented for research use</p> </li> <li> <p>Anonymized metadata (no PII retained)</p> </li> </ul> |
| format | Recurso digital |
| id | zenodo_https___doi_org_10_5281_zenodo_15649359 |
| institution | Zenodo |
| language | bft |
| publishDate | 2025 |
| publisher | Zenodo |
| record_format | zenodo |
| spellingShingle | Balti-Tamko 02: Continuous speech dataset for Balti ASR. Sharif, Muhammad Balti Dataset Continuous Balti Speech Speech Dataset Endangered Language ASR <h3><strong>Balti Continuous Speech Dataset</strong></h3> <p><strong>Overview</strong><br>The Balti Continuous Speech Dataset comprises <strong>read speech recordings</strong> from <strong>118 native Balti speakers</strong> (balanced gender representation) collected across the valleys of Baltistan in northern Pakistan. This corpus is designed to support automatic speech recognition (ASR) research and language preservation efforts for the endangered Balti language.</p> <p><strong>Key Specifications</strong></p> <ul> <li> <p><strong>Volume</strong>: 1.4 GB</p> </li> <li> <p><strong>Duration</strong>: 4.43 hours</p> </li> <li> <p><strong>Samples</strong>: 5,074 audio files (16-bit PCM WAV format, 44.1 kHz)</p> </li> <li> <p><strong>Annotation</strong>: Parallel transcriptions in Perso-Arabic script, with ongoing expansion to include <strong>Yige (Tibetan script)</strong> to capture phonetic nuances and support cross-script ASR development.</p> </li> </ul> <p><strong>Data Structure</strong></p> <ul> <li> <p><strong>Original Split</strong>: 80% training, 20% evaluation (held-out)</p> </li> <li> <p><strong>Proposed Refinement</strong>: 80% training, 10% development (validation), 10% test</p> </li> <li> <p><strong>File Format</strong>:</p> <ul> <li> <p>Audio: <code>.wav</code> (librosa-compatible)</p> </li> <li> <p>Transcripts: <code>.tsv</code> (tab-separated) with <code>S.No</code> and <code>Balti Sentence</code> fields</p> </li> </ul> </li> </ul> <p><strong>Validation & Quality Control</strong></p> <ul> <li> <p>All utterances were <strong>verified by native Balti linguists</strong> to ensure phonetic and lexical accuracy.</p> </li> <li> <p>Sentences were designed to cover <strong>50 distinct linguistic patterns</strong>, balancing lexical diversity and ASR utility.</p> </li> </ul> <p><strong>Unique Value Proposition</strong></p> <ol> <li> <p><strong>Cultural Preservation</strong>: First open corpus to pair Perso-Arabic and Yige (Tibetan) transcriptions, bridging modern and historical Balti orthographies.</p> </li> <li> <p><strong>Research-Ready</strong>: Pre-structured for ASR pipelines (train/dev/test splits) with clear metadata.</p> </li> <li> <p><strong>Low-Resource Focus</strong>: Addresses the scarcity of publicly available Balti speech data.</p> </li> </ol> <p><strong>Potential Applications</strong></p> <ul> <li> <p>Multilingual ASR for endangered languages</p> </li> <li> <p>Cross-script speech recognition (Perso-Arabic ↔ Yige)</p> </li> <li> <p>Phonetic studies of Tibetan-origin languages</p> </li> </ul> <p><strong>Ethical Compliance</strong></p> <ul> <li> <p>Speaker consent documented for research use</p> </li> <li> <p>Anonymized metadata (no PII retained)</p> </li> </ul> |
| title | Balti-Tamko 02: Continuous speech dataset for Balti ASR. |
| topic | Balti Dataset Continuous Balti Speech Speech Dataset Endangered Language ASR |
| url | https://doi.org/10.5281/zenodo.15649359 |