The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Mutisya, Hillary, Mugane, John, Nyamboga, Gavin, Chege, Brian, Gathoni, Maryruth |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
Neural Recovery of Historical Lexical Structure in Bantu Languages from Modern Data
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
Continued Pretraining for Low-Resource Swahili ASR: Achieving State-of-the-Art Performance with Minimal Labeled Data
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus
di: Tosun, Ebubekir, et al.
Pubblicazione: (2026)
di: Tosun, Ebubekir, et al.
Pubblicazione: (2026)
Large Multimodal Models for Low-Resource Languages: A Survey
di: Lupascu, Marian, et al.
Pubblicazione: (2025)
di: Lupascu, Marian, et al.
Pubblicazione: (2025)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
di: Joshi, Raviraj, et al.
Pubblicazione: (2024)
di: Joshi, Raviraj, et al.
Pubblicazione: (2024)
Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil
di: Kishanthan, Sukumar, et al.
Pubblicazione: (2026)
di: Kishanthan, Sukumar, et al.
Pubblicazione: (2026)
SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2024)
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2024)
OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
di: Xue, Yida, et al.
Pubblicazione: (2026)
di: Xue, Yida, et al.
Pubblicazione: (2026)
DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models
di: Thorat, Shantanu, et al.
Pubblicazione: (2025)
di: Thorat, Shantanu, et al.
Pubblicazione: (2025)
PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
di: Rahman, Hanif
Pubblicazione: (2026)
di: Rahman, Hanif
Pubblicazione: (2026)
Synthetic Data Generation in Low-Resource Settings via Fine-Tuning of Large Language Models
di: Kaddour, Jean, et al.
Pubblicazione: (2023)
di: Kaddour, Jean, et al.
Pubblicazione: (2023)
On Limitations of LLM as Annotator for Low Resource Languages
di: Jadhav, Suramya, et al.
Pubblicazione: (2024)
di: Jadhav, Suramya, et al.
Pubblicazione: (2024)
Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation: A Systematic Study
di: Paul, Rakesh, et al.
Pubblicazione: (2025)
di: Paul, Rakesh, et al.
Pubblicazione: (2025)
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
di: Tanksale, Nishant, et al.
Pubblicazione: (2025)
di: Tanksale, Nishant, et al.
Pubblicazione: (2025)
UPRPRC: Unified Pipeline for Reproducing Parallel Resources -- Corpus from the United Nations
di: Lu, Qiuyang, et al.
Pubblicazione: (2025)
di: Lu, Qiuyang, et al.
Pubblicazione: (2025)
MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
Comparative Analysis of Different Efficient Fine Tuning Methods of Large Language Models (LLMs) in Low-Resource Setting
di: Srinivasan, Krishna Prasad Varadarajan, et al.
Pubblicazione: (2024)
di: Srinivasan, Krishna Prasad Varadarajan, et al.
Pubblicazione: (2024)
Bridging the Gap: Enhancing LLM Performance for Low-Resource African Languages with New Benchmarks, Fine-Tuning, and Cultural Adjustments
di: Alhanai, Tuka, et al.
Pubblicazione: (2024)
di: Alhanai, Tuka, et al.
Pubblicazione: (2024)
Grammatical Error Correction for Low-Resource Languages: The Case of Zarma
di: Keita, Mamadou K., et al.
Pubblicazione: (2024)
di: Keita, Mamadou K., et al.
Pubblicazione: (2024)
Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages
di: Toukmaji, Christopher
Pubblicazione: (2024)
di: Toukmaji, Christopher
Pubblicazione: (2024)
Evaluating Fine-Tuned LLM Model For Medical Transcription With Small Low-Resource Languages Validated Dataset
di: Chowdhury, Mohammed Nowshad Ruhani, et al.
Pubblicazione: (2026)
di: Chowdhury, Mohammed Nowshad Ruhani, et al.
Pubblicazione: (2026)
Towards Enhancing Health Coaching Dialogue in Low-Resource Settings
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
On Importance of Layer Pruning for Smaller BERT Models and Low Resource Languages
di: Shirke, Mayur, et al.
Pubblicazione: (2025)
di: Shirke, Mayur, et al.
Pubblicazione: (2025)
Transformer-Driven Triple Fusion Framework for Enhanced Multimodal Author Intent Classification in Low-Resource Bangla
di: Islam, Ariful, et al.
Pubblicazione: (2025)
di: Islam, Ariful, et al.
Pubblicazione: (2025)
KenSwQuAD -- A Question Answering Dataset for Swahili Low Resource Language
di: Wanjawa, Barack W., et al.
Pubblicazione: (2022)
di: Wanjawa, Barack W., et al.
Pubblicazione: (2022)
Optimizing Large Language Models for Turkish: New Methodologies in Corpus Selection and Training
di: Kesgin, H. Toprak, et al.
Pubblicazione: (2024)
di: Kesgin, H. Toprak, et al.
Pubblicazione: (2024)
Lugha-Llama: Adapting Large Language Models for African Languages
di: Buzaaba, Happy, et al.
Pubblicazione: (2025)
di: Buzaaba, Happy, et al.
Pubblicazione: (2025)
ForeCite: Adapting Pre-Trained Language Models to Predict Future Citation Rates of Academic Papers
di: Hull, Gavin, et al.
Pubblicazione: (2025)
di: Hull, Gavin, et al.
Pubblicazione: (2025)
LakotaBERT: A Transformer-based Model for Low Resource Lakota Language
di: Parankusham, Kanishka, et al.
Pubblicazione: (2025)
di: Parankusham, Kanishka, et al.
Pubblicazione: (2025)
A Survey on Automatic Online Hate Speech Detection in Low-Resource Languages
di: Das, Susmita, et al.
Pubblicazione: (2024)
di: Das, Susmita, et al.
Pubblicazione: (2024)
Predicting Machine Translation Performance on Low-Resource Languages: The Role of Domain Similarity
di: Khiu, Eric, et al.
Pubblicazione: (2024)
di: Khiu, Eric, et al.
Pubblicazione: (2024)
Generalizing Large Language Model Usability Across Resource-Constrained
di: Tsai, Yun-Da
Pubblicazione: (2025)
di: Tsai, Yun-Da
Pubblicazione: (2025)
Improving Low-Resource Machine Translation via Cross-Linguistic Transfer from Typologically Similar High-Resource Languages
di: Boujkian, Saughmon
Pubblicazione: (2024)
di: Boujkian, Saughmon
Pubblicazione: (2024)
RedPajama: an Open Dataset for Training Large Language Models
di: Weber, Maurice, et al.
Pubblicazione: (2024)
di: Weber, Maurice, et al.
Pubblicazione: (2024)
Large Language Model Prompt Datasets: An In-depth Analysis and Insights
di: Zhang, Yuanming, et al.
Pubblicazione: (2025)
di: Zhang, Yuanming, et al.
Pubblicazione: (2025)
A Multilingual Sentiment Lexicon for Low-Resource Language Translation using Large Languages Models and Explainable AI
di: Malinga, Melusi, et al.
Pubblicazione: (2024)
di: Malinga, Melusi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering
di: Mutisya, Hillary, et al.
Pubblicazione: (2026) -
Neural Recovery of Historical Lexical Structure in Bantu Languages from Modern Data
di: Mutisya, Hillary, et al.
Pubblicazione: (2026) -
Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation
di: Mutisya, Hillary, et al.
Pubblicazione: (2026) -
Continued Pretraining for Low-Resource Swahili ASR: Achieving State-of-the-Art Performance with Minimal Labeled Data
di: Mutisya, Hillary, et al.
Pubblicazione: (2026) -
A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus
di: Tosun, Ebubekir, et al.
Pubblicazione: (2026)