Guardado en:
| Autores principales: | Rahman, Hanif, Rehman, Shafeeq ur |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.27021 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
por: Rahman, Hanif
Publicado: (2026)
por: Rahman, Hanif
Publicado: (2026)
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
por: Rahman, Hanif
Publicado: (2026)
por: Rahman, Hanif
Publicado: (2026)
Fine-tuning Whisper for Pashto ASR: strategies and scale
por: Rahman, Hanif
Publicado: (2026)
por: Rahman, Hanif
Publicado: (2026)
PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech
por: Rahman, Hanif
Publicado: (2026)
por: Rahman, Hanif
Publicado: (2026)
From Scarcity to Scale: A Release-Level Analysis of the Pashto Common Voice Dataset
por: Jahani, Jandad, et al.
Publicado: (2026)
por: Jahani, Jandad, et al.
Publicado: (2026)
Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpus
por: Ouzerrout, Samy
Publicado: (2025)
por: Ouzerrout, Samy
Publicado: (2025)
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
por: Oberkircher, Lena S., et al.
Publicado: (2026)
por: Oberkircher, Lena S., et al.
Publicado: (2026)
Giving Voice to the Constitution: Low-Resource Text-to-Speech for Quechua and Spanish Using a Bilingual Legal Corpus
por: Ortega, John E., et al.
Publicado: (2026)
por: Ortega, John E., et al.
Publicado: (2026)
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
por: Krsteski, Stefan, et al.
Publicado: (2025)
por: Krsteski, Stefan, et al.
Publicado: (2025)
SloPal: A 60-Million-Word Slovak Parliamentary Corpus with Aligned Speech and Fine-Tuned ASR Models
por: Božík, Erik, et al.
Publicado: (2025)
por: Božík, Erik, et al.
Publicado: (2025)
Developing an Open Conversational Speech Corpus for the Isan Language
por: Na-Thalang, Adisai, et al.
Publicado: (2025)
por: Na-Thalang, Adisai, et al.
Publicado: (2025)
Building Efficient and Effective OpenQA Systems for Low-Resource Languages
por: Budur, Emrah, et al.
Publicado: (2024)
por: Budur, Emrah, et al.
Publicado: (2024)
SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages
por: Xu, Tianyi, et al.
Publicado: (2026)
por: Xu, Tianyi, et al.
Publicado: (2026)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
por: Merx, Raphaël, et al.
Publicado: (2025)
por: Merx, Raphaël, et al.
Publicado: (2025)
Quechua Speech Datasets in Common Voice: The Case of Puno Quechua
por: Huaman, Elwin, et al.
Publicado: (2025)
por: Huaman, Elwin, et al.
Publicado: (2025)
GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages
por: Kargaran, Amir Hossein, et al.
Publicado: (2024)
por: Kargaran, Amir Hossein, et al.
Publicado: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
por: Li, Chin-Jou, et al.
Publicado: (2025)
por: Li, Chin-Jou, et al.
Publicado: (2025)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
por: Lu, Zhiyuan, et al.
Publicado: (2026)
por: Lu, Zhiyuan, et al.
Publicado: (2026)
Speech-to-Speech Translation Pipelines for Conversations in Low-Resource Languages
por: Popescu-Belis, Andrei, et al.
Publicado: (2025)
por: Popescu-Belis, Andrei, et al.
Publicado: (2025)
Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization
por: Tomashenko, Natalia, et al.
Publicado: (2024)
por: Tomashenko, Natalia, et al.
Publicado: (2024)
Low-Resource Safety Failures Are Action Failures, Not Representation Failures
por: Aziz, Rashad, et al.
Publicado: (2026)
por: Aziz, Rashad, et al.
Publicado: (2026)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
por: Yadav, Sumit, et al.
Publicado: (2025)
por: Yadav, Sumit, et al.
Publicado: (2025)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
por: Toyin, Hawau Olamide, et al.
Publicado: (2025)
por: Toyin, Hawau Olamide, et al.
Publicado: (2025)
Enhancing Voice Wake-Up for Dysarthria: Mandarin Dysarthria Speech Corpus Release and Customized System Design
por: Gao, Ming, et al.
Publicado: (2024)
por: Gao, Ming, et al.
Publicado: (2024)
FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions
por: Teixeira, Francisco, et al.
Publicado: (2026)
por: Teixeira, Francisco, et al.
Publicado: (2026)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
por: Monir, Nasser-Eddine, et al.
Publicado: (2026)
por: Monir, Nasser-Eddine, et al.
Publicado: (2026)
Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification
por: D, Anusha M, et al.
Publicado: (2025)
por: D, Anusha M, et al.
Publicado: (2025)
Assessing the Feasibility of Lightweight Whisper Models for Low-Resource Urdu Transcription
por: Antall, Abdul Rehman, et al.
Publicado: (2025)
por: Antall, Abdul Rehman, et al.
Publicado: (2025)
Speak & Improve Corpus 2025: an L2 English Speech Corpus for Language Assessment and Feedback
por: Knill, Kate, et al.
Publicado: (2024)
por: Knill, Kate, et al.
Publicado: (2024)
Commonality and Individuality! Integrating Humor Commonality with Speaker Individuality for Humor Recognition
por: Zhu, Haohao, et al.
Publicado: (2025)
por: Zhu, Haohao, et al.
Publicado: (2025)
Building a Non-native Speech Corpus Featuring Chinese-English Bilingual Children: Compilation and Rationale
por: Hung, Hiuchung, et al.
Publicado: (2023)
por: Hung, Hiuchung, et al.
Publicado: (2023)
CV-18 NER: Augmented Common Voice for Named Entity Recognition from Arabic Speech
por: Saidi, Youssef, et al.
Publicado: (2026)
por: Saidi, Youssef, et al.
Publicado: (2026)
FeruzaSpeech: A 60 Hour Uzbek Read Speech Corpus with Punctuation, Casing, and Context
por: Povey, Anna, et al.
Publicado: (2024)
por: Povey, Anna, et al.
Publicado: (2024)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
por: Mutisya, Hillary, et al.
Publicado: (2026)
por: Mutisya, Hillary, et al.
Publicado: (2026)
Quantifying Geospatial in the Common Crawl Corpus
por: Ilyankou, Ilya, et al.
Publicado: (2024)
por: Ilyankou, Ilya, et al.
Publicado: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
por: Phatthiyaphaibun, Wannaphong, et al.
Publicado: (2025)
por: Phatthiyaphaibun, Wannaphong, et al.
Publicado: (2025)
BnTTS: Few-Shot Speaker Adaptation in Low-Resource Setting
por: Basher, Mohammad Jahid Ibna, et al.
Publicado: (2025)
por: Basher, Mohammad Jahid Ibna, et al.
Publicado: (2025)
Building a Large Japanese Web Corpus for Large Language Models
por: Okazaki, Naoaki, et al.
Publicado: (2024)
por: Okazaki, Naoaki, et al.
Publicado: (2024)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
por: Joshi, Raviraj, et al.
Publicado: (2024)
por: Joshi, Raviraj, et al.
Publicado: (2024)
Ejemplares similares
-
PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
por: Rahman, Hanif
Publicado: (2026) -
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
por: Rahman, Hanif
Publicado: (2026) -
Fine-tuning Whisper for Pashto ASR: strategies and scale
por: Rahman, Hanif
Publicado: (2026) -
PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech
por: Rahman, Hanif
Publicado: (2026) -
From Scarcity to Scale: A Release-Level Analysis of the Pashto Common Voice Dataset
por: Jahani, Jandad, et al.
Publicado: (2026)